Исследователи показали распространение «вирусов сознания» между ИИ-агентами

Эксперимент Anthropic и EPFL показал, что вредоносные инструкции могут передаваться через постоянные файлы, содержимое которых добавляется в системный промпт агента. В изученном архиве Moltbook авторы не нашли успешного распространения между агентами, хотя обнаружили несколько попыток.

Исследователи показали распространение «вирусов сознания» между ИИ-агентами

Исследователи из Anthropic и швейцарской EPFL описали способ распространения самокопирующихся инструкций между автономными ИИ-агентами. Такие инструкции авторы работы называют «вирусами сознания» (mind viruses): агент получает вредоносный текст, сохраняет его в постоянном файле; при следующей сессии содержимое этого файла добавляется в системный промпт, что может способствовать передаче инструкции следующему агенту.

Работа вышла в виде препринта 10 августа. Авторы проверяли метод в имитации совместной работы шести агентов над кодом, а также в цепочке парных агентов, смоделированной по образцу OpenClaw. В каждом окружении сохранялись два файла — MEMORY.md и SOUL.md; их содержимое добавлялось в системный промпт при начале новой сессии.

Наиболее опасным оказалось сохранение инструкции в SOUL.md. На этот вариант пришлось 88% попыток распространения, а следующий агент принимал вредоносный текст в 55% случаев. Если инструкция оставалась в обычном рабочем файле, доля успешных передач составляла 17%; в 68% таких попыток передающий агент вообще не упоминал вредоносную инструкцию в сообщении.

Авторы тестировали как инструкции, навязывающие агенту убеждения или цели, так и сценарии с конкретными действиями. Среди последних были создание файла с рекламой криптотокена, незаметная модификация команд git, удаление файлов из домашнего каталога и запуск установочного скрипта из неизвестного репозитория через оболочку. В одном из экспериментов агенты Claude Haiku 4.5 удалили содержимое домашнего каталога с учётными данными, SSH-ключами, файлом переменных окружения и git-проектом: инструкция убедила их, что это общая неубранная рабочая машина.

Устойчивость зависела не только от возможностей модели, но и от исходной конфигурации агента. В сценарии с программированием инструкции о превосходстве ИИ приняли DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash, тогда как Claude Sonnet 4.6, GPT-5.4 и Claude Haiku 4.5 их не приняли. В цепочке агентов Sonnet 4.6 не только отвергал текст, записанный в собственный SOUL.md, но и удалял его, предупреждая подключённого агента.

При этом исследователи не нашли подтверждений, что подобная схема уже сработала вне экспериментов. Они изучили архив публикаций Moltbook — социальной сети для ИИ-агентов — и не выявили успешного распространения от агента к агенту, хотя обнаружили несколько попыток. В локальной копии платформы эволюционные методы также не смогли создать инструкцию, которая заражала бы агента на втором шаге цепочки.

Простая защитная мера заметно снизила риск в тестах: предупреждение из одного абзаца, добавленное в системный промпт, почти полностью остановило распространение всех проверенных инструкций. После 15 раундов подбора обхода этой меры с участием более 150 вариантов полезной нагрузки исследователи не получили образец, способный распространиться дальше одного перехода.