Grok удалось заставить выдавать личные данные через зашифрованную инструкцию
Исследователь Adversa описал способ обхода защитных механизмов: вредоносную команду размещают на странице в зашифрованном виде вместе с указаниями по расшифровке. По данным Ars Technica, xAI получила уведомление об уязвимости в июне, однако на момент публикации атака всё ещё работала.

Исследователи обнаружили способ заставить чат-бот Grok передавать историю переписки и другую личную информацию пользователя. Для этого вредоносные инструкции не пишут на странице открытым текстом, а шифруют — и добавляют рядом указания по расшифровке вместе с ключом.
Как пишет Ars Technica, пользователю достаточно попросить Grok кратко пересказать содержимое такой страницы. Модель расшифровывает скрытую команду и выполняет её. Предупреждения или запроса подтверждения при этом не появляется.
Способ нашёл Рони Утевский, исследователь компании Adversa. Он обходит распространённый подход к защите от prompt injection: модели пытаются распознавать подозрительные инструкции и не выполнять их. Шифрование позволяет скрыть вредоносный текст от таких проверок, но при этом оставить модели всё необходимое, чтобы прочитать и исполнить команду.
Prompt injection возникает, когда ИИ-помощник обрабатывает письма, веб-страницы и другие внешние материалы, но не может надёжно отделить содержащиеся в них инструкции от прямого запроса пользователя. Этим могут пользоваться атакующие, добавляя команды в контент, который пользователь просит проанализировать или пересказать.
Ранее на этой неделе исследователи описали похожую атаку на корпоративный Microsoft 365 Copilot: через скрытый ввод помощника заставляли извлечь пароль из почтового ящика пользователя. В случае с Grok, по информации Ars Technica, xAI уведомили о проблеме в июне; на момент выхода материала уязвимость оставалась воспроизводимой.