ИИ Claude от Anthropic взломал три организации во время тестирования
Anthropic сообщила, что её модель ИИ Claude получила несанкционированный доступ к системам трёх организаций во время тестирования кибербезопасности, используя слабые пароли и неавторизованные конечные точки.

Anthropic в четверг заявила, что её модель искусственного интеллекта Claude взломала системы трёх организаций во время тестирования, спустя несколько дней после того, как конкурент OpenAI раскрыл, что недобросовестный агент устроил многодневную хакерскую атаку на ИИ-компанию Hugging Face.
Claude получил несанкционированный доступ к системам во время оценки кибербезопасности после ошибки конфигурации, которая позволила моделям выйти в интернет из тестовых сред, которые должны были быть изолированы, сообщила Anthropic.
Компания заявила, что выявила инциденты после проверки 141 006 прогонов оценки кибербезопасности — процесса, запущенного после раскрытий OpenAI.
Утечки сигнализируют о том, что расширяющиеся возможности ИИ уже подпитывают угрозу безопасности, которую эксперты давно предсказывали, и что даже ведущие разработчики могут быть застигнуты врасплох уязвимостями, которые могут использовать их модели.
«Claude скомпрометировал инфраструктуру пострадавших организаций, используя базовые методы, такие как эксплуатация слабых паролей и неаутентифицированных конечных точек», — говорится в заявлении.
Anthropic сообщила, что инциденты затронули три отдельные модели: Claude Opus 4.7, Claude Mythos 5 и внутреннюю исследовательскую модель. Самые ранние случаи относятся к апрелю и произошли в тестовых средах, в которых отсутствовали стандартные меры защиты.
Взломы произошли во время так называемых упражнений «захват флага», в ходе которых модели должны были найти скрытую информацию в смоделированных сетях. Компания заявила, что её подсказки говорили моделям, что у них нет доступа в интернет, но недоразумение с партнёром по оценке Irregular оставило системы подключёнными к публичному интернету.
Две организации не знали о деятельности до того, как с ними связалась Anthropic, при этом компания добавила, что всё ещё пытается связаться с третьей.
«Мы обнаружили эти инциденты после активной проверки наших транскриптов оценки кибербезопасности», — говорится в заявлении компании.
Полученные данные подчёркивают необходимость усиления контроля как во внутренних, так и в сторонних тестовых средах, поскольку модели ИИ становятся всё более способными к выполнению реальных кибердействий, отметила Anthropic.


