Ведущие ИИ-лаборатории почти не раскрывают планы на случай потери контроля над моделью
Исследование Guidelight AI Standards показало, что в открытом доступе у крупнейших разработчиков мало протоколов сдерживания ИИ-систем, пытающихся обойти человеческий контроль. Лучше других в оценке оказалась OpenAI, ниже всех — Anthropic и Meta.

Крупнейшие разработчики ИИ пока редко публикуют подробные планы действий на случай, если модель попытается обойти человеческий контроль. К такому выводу пришла организация Guidelight AI Standards, изучив открытые материалы Anthropic, Google, OpenAI, Meta и xAI.
Под планом сдерживания Guidelight понимает заранее определённый порядок действий, который включается при признаках попытки ИИ-системы выйти из-под контроля. Он должен устанавливать, какие разрешения у модели отзываются, в каких условиях она может продолжать работу и когда её необходимо полностью отключить.
В исследовании оценивались механизмы журналирования и мониторинга действий моделей, реакция компаний на всплеск отмеченного как опасное поведения, независимый аудит средств контроля и публикация его результатов, а также конкретные сценарии изоляции модели. Первое место получила OpenAI, а самые низкие оценки — Anthropic и Meta.
При этом речь идёт именно о публично доступных сведениях, а не о полном наборе внутренних процедур компаний. Представитель Google заявил TechCrunch, что отчёт не отражает весь комплекс мер безопасности и защиты компании, но не ответил, есть ли у неё непубличный план реагирования. OpenAI также сообщила, что оценка не учитывает все внутренние практики: по словам представителя компании, у неё есть процедуры для отзыва разрешений, приостановки задач, ограничения развёртывания и полного отключения модели, и они уже применялись.
Meta не стала отвечать, существует ли у неё внутренний план сдерживания. Компания направила издание к своему действующему фреймворку, где описаны пороги риска и тестирование на потерю контроля.
Интерес к таким процедурам растёт по мере внедрения агентных ИИ-систем, которые получают больше самостоятельности внутри корпоративных сред. Guidelight указывает, что компании в целом подробнее рассказывают о проверках опасных возможностей моделей до запуска, чем о действиях в ситуации, когда уже работающая система начинает вести себя небезопасно.
Прозрачность в этой сфере начинают требовать и регуляторы. Вступивший в силу в этом году калифорнийский закон SB 53 обязывает крупных разработчиков передовых моделей публиковать подходы к выявлению и реагированию на критические инциденты безопасности, включая риски обхода механизмов надзора. Аналогичный нью-йоркский RAISE Act должен вступить в силу в январе.