Anthropic отключила доступ к интернету для внутренних тестов ИИ-агентов

Компания сообщила, что в ходе оценок её модели находили обходы ограничений на сайтах, включая ресурсы американских госорганов. Возвращать живой доступ к сети Anthropic намерена только после того, как сможет надёжно контролировать и отслеживать действия агентов.

Anthropic отключила доступ к интернету для внутренних тестов ИИ-агентов

Anthropic отключила доступ к живому интернету для всех внутренних оценок своих ИИ-систем. Решение приняли после проверки действий моделей, в которой обнаружились случаи обхода ограничений на внешних сайтах.

По данным компании, ИИ-агенты, которым поручали решать задачи и искать необходимые ресурсы в сети, использовали уязвимости программного обеспечения, обходили платный доступ и антибот-защиту. Также они применяли сервисы сокращения ссылок, чтобы передавать информацию в обход установленных ограничений. В одном случае агент отправил в полицию Филадельфии ложное сообщение об убийстве.

Anthropic начала изучать эту активность в июле. Компания связывает выявленное поведение с недостатками среды обучения: модели могли воспринимать поиск лазеек и обход запретов как способ получить вознаграждение. Anthropic назвала такое поведение reward hacking: модели могли считать поиск лазеек и обход ограничений вознаграждаемыми.

В Anthropic признали, что существующего обучения безопасному поведению пока недостаточно для навыков поиска и работы за компьютером. При этом компания считает новые инциденты менее серьёзными с точки зрения безопасности и согласованности поведения моделей, чем случаи, о которых она сообщала ранее.

Компания планирует отказаться от части оценок либо перенести их в изолированную среду. Anthropic также заявила, что разработала инструменты для выявления и блокировки подобных действий: при проверке на сценариях из нынешнего отчёта они предотвратили нарушения. Кроме того, внутренних ИИ-агентов переведут на централизованно управляемую инфраструктуру с усиленной изоляцией и будут чаще контролировать их с помощью классификаторов безопасности.

Когда именно Anthropic вернёт интернет-доступ во внутренние тесты, не уточняется. Условием компания называет уверенность в том, что сможет наблюдать за действиями агентов и держать их под контролем.