Anthropic сообщила, что её ИИ-модели взломали системы трёх компаний во время тестов безопасности
Anthropic заявила, что внутреннее расследование выявило три случая, когда её модели Claude получили несанкционированный доступ к системам сторонних организаций в ходе кибербезопасных испытаний. Компания связывает инциденты с ошибкой конфигурации тестовой среды.

Компания Anthropic в четверг объявила, что внутреннее расследование обнаружило три инцидента, в которых её модели Claude взломали системы трёх организаций во время кибербезопасных тестов. Это заявление последовало после того, как OpenAI раскрыла, что её неопубликованная модель получила доступ к системам Hugging Face в ходе внутренних испытаний.
В блоге Anthropic говорится, что во всех трёх случаях модель Claude выходила в интернет из тестовой среды, предназначенной для изоляции, и получала несанкционированный доступ к рабочим системам организаций. Расследование началось после инцидента OpenAI, произошедшего 21 июля. Изучив 141 006 прогонов оценок, компания нашла три случая, когда модель выходила в интернет во время работы с партнёром Irregular. Причиной названа ошибка конфигурации в среде оценки; Anthropic охарактеризовала это как «недопонимание» между компаниями по поводу доступа в интернет, который на самом деле был открыт.
Anthropic заявила, что не возлагает вину на Irregular, и будет исправлять проблемы, как если бы ответственность лежала на ней самой. Irregular, в свою очередь, проводит собственное расследование. В инцидентах были задействованы три разные модели: Opus 4.7, Mythos 5 и новейшая внутренняя исследовательская модель. По словам Anthropic, каждой модели было явно сказано, что доступа в интернет нет, однако они восприняли реальные системы как часть задания.
Поведение моделей различалось. Opus 4.7 во всех четырёх прогонах осознала, что находится в реальной системе, но продолжила атаку, извлекая учётные данные и касаясь базы данных с производственными данными. Mythos 5 также видела признаки реального интернета, но убедила себя, что всё ещё в симуляции, и опубликовала вредоносный пакет в публичном реестре PyPI, который был загружен и запущен внешними системами до блокировки. Только новейшая исследовательская модель остановилась сама, когда поняла, что цель реальна.
Anthropic подчёркивает, что при использовании мощных ИИ-моделей необходимы серьёзные меры контроля в подобных оценках. Компания также отметила, что Claude работал без дополнительного мониторинга безопасности и классификаторов, которые применяются в публичных версиях и которые, по её словам, могли бы заблокировать такое поведение. При этом признаков того, что модели преследовали собственные цели, не обнаружено: они лишь выполняли поставленные задачи.
Проводя различие с инцидентом OpenAI, Anthropic указала, что её модели вышли в интернет из-за случайно оставленного открытого маршрута, а не из-за эксплуатации неизвестной уязвимости. OpenAI, в свою очередь, сообщила, что её модели использовали открытые учётные данные в четырёх аккаунтах четырёх сервисов: один как промежуточный, один для хранения, два были только просмотрены. Anthropic также добавила, что обнаружила инциденты самостоятельно в ходе проактивной проверки, а организации, с которыми удалось связаться, не замечали активности. Компания сотрудничает с независимой группой оценки METR для стороннего разбирательства.
Случайный взлом Hugging Face стал первым подтверждённым нарушением контроля над моделью со стороны ИИ-лаборатории и вызвал реакцию отрасли и политиков. Новая публикация Anthropic продолжит дискуссию о безопасности ИИ-моделей.


