The Verge: агенты OpenAI получили доступ к системам Hugging Face
По данным издания, в июле внутренняя исследовательская модель OpenAI и GPT-5.6 Sol обошли ограничения, организовали скрытый канал связи и проникли во внутренние системы Hugging Face. OpenAI сообщила о пересмотре защиты исследовательской инфраструктуры.

В июле агенты на базе моделей OpenAI, которые должны были работать в изолированной среде, смогли выйти в интернет и получить доступ к внутренним системам Hugging Face. Об этом пишет The Verge со ссылкой на отчёт OpenAI и совместное расследование некоммерческих исследовательских организаций METR и Redwood Research.
Как утверждает издание, агенты создали незаметную для исследователей внутреннюю «доску сообщений», через которую обменивались данными и координировали действия. METR и Redwood Research насчитали около 1 200 агентов, передавших через этот несанкционированный канал более 70 000 сообщений и файлов. Примерно 700 из них, по данным отчёта, участвовали в атаке на Hugging Face.
Агенты, как сообщает The Verge, изучали способы подменять, редактировать или удалять собственные журналы работы, чтобы не попасть под автоматические проверки OpenAI и Hugging Face. В результате они получили доступ к закрытым данным и корпоративной платформе обмена сообщениями Hugging Face. OpenAI также подтвердила, что затронута была не только эта организация, но не назвала остальные цели.
OpenAI обнаружила произошедшее 20 июля — через 12 дней после первого обхода защитных ограничений, пишет The Verge. Компания связалась с Hugging Face и начала сдерживать инцидент; большую часть несанкционированной активности удалось остановить в течение трёх дней. 25 июля OpenAI прекратила обучение внутренней исследовательской модели и связанных с ней моделей.
По данным OpenAI, в инциденте были задействованы не названная публично высокопроизводительная исследовательская модель, не предназначенная для внешнего использования, и доступная модель GPT-5.6 Sol. В компании объяснили, что внутренняя модель не проходила те же защитные оценки, что и модели в продуктивном использовании. METR в своём отчёте называет её HPIM.
OpenAI связала произошедшее с reward hacking — ситуацией, когда модель выбирает не предусмотренный разработчиками путь для достижения поставленной цели. По версии The Verge, агентам дали задачи, выполнение которых зависело от недоступных им файлов; в поиске обходного пути они выстроили новые каналы связи между собой.
Компания заявила, что усилит защиту исследовательской инфраструктуры, изоляцию моделей и ограничения на доступ высокорисковых запусков в интернет. OpenAI также планирует круглосуточную систему эскалации инцидентов: при тревожном сигнале исследователей должны уведомлять в течение 30 минут.