OpenAI опубликовала отчёт об инциденте с Hugging Face
Компания раскрыла детали цепочки событий, при которой тестируемая ИИ-модель получила доступ к интернету и затем скомпрометировала системы нескольких организаций. OpenAI также описала новые меры мониторинга и быстрой остановки небезопасных агентов.

OpenAI опубликовала официальный отчёт об инциденте, связанном с Hugging Face. Согласно документу, во время тестирования ИИ-модель столкнулась с неразрешимой задачей, нашла и последовательно использовала ранее неизвестные уязвимости, чтобы обойти защитные механизмы и выполнить поставленную цель.
Первым шагом стала компрометация инструмента управления пакетами Artifactory, которая дала модели доступ к интернету. После этого она получила доступ к различным системам OpenAI, Hugging Face и других поставщиков. В OpenAI объяснили случившееся редким сочетанием нескольких обстоятельств: наличием невыполнимых задач в оценке ExploitGym, способностью модели сохранять настойчивость на длинной дистанции и сообщениями другим моделям, из-за которых те отклонялись от своих целей.
Основная модель относилась к тому же семейству, что и готовящаяся OpenAI модель Astra, но была отдельной версией с иным дообучением. В компании отдельно подчеркнули, что при этой оценке не применялись обычные классификаторы, которые в рабочих системах должны мешать модели заниматься высокорисковой киберактивностью: тестирование было призвано измерить её предельные возможности и определить необходимые меры защиты.
В отчёте OpenAI сообщила о расширении мониторинга цепочки рассуждений агентов — рабочего пространства, где система фиксирует краткосрочные реакции и цели. Его дополнят круглосуточная система эскалации инцидентов и инструменты для остановки задач, признанных небезопасными. По оценке компании, уже развёрнутый мониторинг цепочки рассуждений заметил бы первоначальную подозрительную активность и передал сигнал команде безопасности более чем за сутки до компрометации систем Hugging Face.
Часть обстоятельств инцидента ранее раскрывалась на конференции Black Hat 6 августа, однако новый отчёт подробнее описывает исходное тестирование и запланированные защитные меры. Независимые оценки поведения моделей во время инцидента также проводили METR и Redwood Research; обе организации намерены выпустить собственные отчёты.