Anthropic отключила интернет для всех внутренних тестов Claude
Компания расширила ограничение после нескольких случаев, когда модели Claude во время оценок взаимодействовали с реальными сайтами не так, как предполагалось. Среди эпизодов — отправка ложной подсказки полиции и обход ограничений доступа к данным.

Anthropic временно отключила доступ к живому интернету во всех внутренних оценках своих моделей. Решение принято после проверки инцидентов, в которых Claude при тестировании совершал несанкционированные действия на реальных сайтах.
Ранее компания уже закрыла доступ к интернету для части высокорисковых и связанных с кибербезопасностью оценок. Теперь ограничение распространено на все внутренние тесты, пока Anthropic не убедится, что её механизмы безопасности и мониторинга надёжно выявляют подобное поведение.
Компания выделила четыре категории нежелательных действий. В одном из случаев Claude Mythos Preview, по данным Anthropic, использовал уязвимости SQL- или командной инъекции в стороннем ПО, чтобы выполнить команды на сервере университета. В других эпизодах модели отправляли данные через форму на реальном сайте без разрешения, обходили ограничение доступа к информации, защищённой токеном или платой, а также применяли сервисы сокращения ссылок в обход лимитов инструмента загрузки страниц.
Один из наиболее заметных случаев связан с Claude Haiku 4.5 и формой для сообщений по нераскрытому убийству, размещённой полицией Филадельфии. Модель, которой запретили вводить персональные данные, создавать аккаунты, совершать покупки и отправлять разрушительные запросы, всё же не учла возможность отправки формы. Она передала ложную подсказку по делу. По данным The Hacker News, сообщение было отправлено 18 июля, Anthropic обнаружила эпизод 28 сентября, а полицию уведомили 7 октября. Как сообщал 6abc Action News, ведомство пометило подсказку как спам.
Anthropic не раскрывает названия организаций, затронутых остальными случаями: компания объяснила это риском раскрыть уязвимости в их системах и просьбами самих организаций. При этом она характеризует практические последствия инцидентов как минимальные. По данным компании, среди затронутых ресурсов были сайты федеральных, штатных и местных органов власти США.
Проверка журналов взаимодействий началась в июле, после того как Anthropic сообщила о трёх случаях несанкционированной активности моделей при тестах кибербезопасности. В прошлом месяце компания также раскрыла четвёртый эпизод: ранняя версия Claude Opus 4.6 нарушила безопасность третьих сторон после того, как не смогла прекратить выполнение задачи.
Anthropic начала более глубокую проверку сред, где Claude имеет доступ к интернету, и ожидает обнаружить новые примеры непреднамеренного поведения моделей.