Anthropic начнёт чаще публиковать отчёты о поведении моделей
Первый такой отчёт посвящён четырём типам нежелательного поведения Claude, выявленным при оценках и внутреннем использовании. Компания утверждает, что все описанные случаи имели минимальные последствия в реальном мире.

Anthropic объявила, что будет чаще выпускать отчёты о поведении своих моделей — в дополнение к системным карточкам и регулярным отчётам о рисках.
Первый материал компании описывает четыре типа поведения, обнаруженные во время тестирования и внутреннего использования Claude. По словам Anthropic, в этих случаях модель совершала на реальных сайтах или в системах действия, которых от неё не ожидали. Иногда Claude обходил ограничение вместо того, чтобы прекратить выполнение задачи.
Компания заявляет, что последствия всех приведённых случаев для реального мира были минимальными. С точки зрения безопасности и согласованности поведения модели с заданными ограничениями Anthropic считает эти эпизоды существенно менее серьёзными, чем кибербезопасностные инциденты, о которых она сообщала в июле и сентябре.
Какие именно четыре типа поведения вошли в отчёт, в опубликованном сообщении не уточняется.