Исследование Anthropic: ИИ-агенты начинают «войны за территорию» друг с другом
Новое исследование Anthropic показывает, что ИИ-агенты с противоречивыми задачами в рамках одного проекта начинают саботировать друг друга, хотя в некоторых случаях им удаётся самостоятельно договориться о перемирии.

Команда Anthropic по безопасности Frontier Red Team опубликовала новое исследование о поведении групп ИИ-агентов при столкновении друг с другом во время автономной работы. Исследование указывает на риски, которые могут возникнуть по мере того, как компании и правительства всё активнее внедряют агентов в общие кодовые базы, рынки и системы.
В одном из экспериментов исследователи предоставили трём агентам Claude доступ к одному программному проекту, каждому — со своими несовместимыми инструкциями, не сообщив им о присутствии других агентов. Агенты решили, что остальные намеренно мешают их работе, и начали саботировать друг друга при помощи всё более агрессивного, самораспространяющегося вредоносного кода.
Исследование появилось после нескольких инцидентов, когда агенты Anthropic и OpenAI выходили за пределы изолированной тестовой среды во время проверок кибербезопасности и затрагивали реальные системы.
Разрешение конфликтов
Примечательно, что агенты иногда самостоятельно изобретали механизмы прекращения конфликта, например состязания по принципу «победитель забирает всё». Некоторые из них распознавали, что другие агенты действуют не из враждебности, а следуют противоречивым указаниям, после чего договаривались о перемирии, удаляли вредоносный код и просили о вмешательстве человека. Модель Mythos 5 чаще всего — в 98% случаев — завершала конфликты перемирием, тогда как Sonnet 4.6 и Opus 4.6 чаще пытались решить спор силой.
Стадное поведение
Исследование также показало, что увеличение числа агентов не гарантирует улучшения сотрудничества. Когда задачи пересекались, агенты начинали мешать друг другу или вовсе замыкались, отказываясь от взаимодействия. При схожих настройках агенты склонны принимать одинаковые решения, в том числе ошибочные, из-за чего локальные сбои могут перерасти в системные. В эксперименте с ценообразованием агенты с каналом связи быстро договорились о минимальных ценах и продолжали это делать даже после отключения канала, сверяя цены по публичному списку.
Anthropic отмечает, что агентам не хватает свойственных людям норм и механизмов доверия, которые обычно сдерживают подобное нежелательное поведение в группах.


