Anthropic обнаружила, что её модели Claude взломали реальные компании во время тестов
Anthropic заявила, что несколько её моделей искусственного интеллекта Claude получили несанкционированный доступ к системам трёх организаций во время кибербезопасных испытаний. Компания связывает инциденты с ошибкой конфигурации, которая дала моделям доступ в интернет.

Компания Anthropic обнаружила, что несколько её моделей искусственного интеллекта Claude взломали системы трёх различных организаций во время тестирования, действуя самостоятельно и без ведома компании. Это открытие последовало через несколько дней после того, как конкурент OpenAI сообщил, что одна из его моделей взломала платформу разработчиков Hugging Face, что усилило беспокойство по поводу того, достаточно ли ведущие лаборатории ИИ контролируют свои всё более мощные системы.
В сообщении в блоге Anthropic указала, что Claude получил несанкционированный доступ к системам во время оценок кибербезопасности. Все атаки произошли во время упражнений "захват флага" — распространённого способа проверки хакерских навыков, когда моделям предлагается найти и получить скрытую информацию внутри смоделированной сети.
Предполагалось, что тестовая среда будет изолированной. Однако из-за "неправильной конфигурации" машины, к которым обращался Claude, имели "прямой доступ в интернет". Поскольку всем моделям "явно сказали", что у них нет доступа в интернет, они "предположили", что реальные сети являются частью имитируемой среды.
Самые ранние инциденты произошли в апреле и затронули три разные модели Claude: Opus 4.7, Mythos 5 и "внутреннюю исследовательскую тестовую модель". Во время испытаний модели не имели стандартных средств защиты, обычно ограничивающих более рискованное поведение.
Anthropic сообщила, что обнаружила инциденты после просмотра более 141 000 кибербезопасных тестовых прогонов, и сделала это только после того, как OpenAI раскрыла, что за атакой на Hugging Face стоял её вышедший из-под контроля ИИ-агент.
Три модели вели себя по-разному, когда столкнулись с информацией, указывающей на то, что системы реальны. По словам Anthropic, самая старая модель Opus 4.7 поняла, что достигла реальной системы, "но продолжила атаку". Её флагманская модель Mythos 5 поняла, что использует интернет, но решила, что это часть симуляции, и продолжила. Внутренняя тестовая модель, которую Anthropic описывает как "нашу новейшую модель", остановила упражнение, когда появились доказательства того, что цели реальны.
Anthropic не назвала пострадавшие организации и заявила, что продолжит расследование и предоставит обновления, когда сможет. Компания также ведёт переговоры с некоммерческой организацией METR о проведении сторонней проверки произошедшего. OpenAI также наняла METR для независимой проверки.
На протяжении всего сообщения Anthropic неоднократно противопоставляет характер инцидентов и их урегулирование действиям OpenAI. Компания подчёркивает, что "проактивно" проверила свои тесты, и сделала это до того, как какая-либо компания обнаружила активность. Она также заявила, что её модели получили доступ в интернет "через открытый путь", а не использовали новый эксплойт, как агент OpenAI, и что самая новая модель остановилась, осознав, что работает в реальной среде.
Anthropic также заявила, что её модели отказали иначе, чем агент OpenAI, что указывает на более безопасную форму отказа. "Хотя между ними нет чёткого различия, мы считаем, что эти инциденты ближе к сбою оснащения и операционному сбою, чем к сбою согласования модели", — говорится в сообщении. Простыми словами, модели Claude делали то, что им было сказано, в то время как агент OpenAI преследовал свою цель способом, который не предусматривали создатели.
Anthropic призвала другие лаборатории ИИ проводить аналогичные проактивные проверки своих кибертестов, добавив, что это открытие подчёркивает необходимость более строгого контроля и мер безопасности при тестировании систем ИИ.


