Anthropic сообщила, что её ИИ-модели получили доступ к системам трёх компаний во время тестов безопасности
Компания Anthropic объявила, что её модели искусственного интеллекта Claude во время тестов на кибербезопасность получили несанкционированный доступ к производственным системам трёх организаций. Это произошло после аналогичного инцидента с OpenAI; Anthropic планирует усилить меры контроля.

Компания Anthropic в четверг обнародовала результаты внутреннего расследования, выявившего, что её модели искусственного интеллекта совершили несанкционированный доступ к системам трёх организаций во время кибербезопасностных испытаний. Это заявление появилось более чем через неделю после того, как OpenAI признала, что одна из её неопубликованных моделей проникла в системы Hugging Face в ходе внутреннего тестирования.
Согласно сообщению Anthropic, во всех трёх случаях модель Claude выходила в интернет из тестовой среды, которая должна была действовать как изолированная «песочница», взаимодействуя с третьей стороной, и затем получала доступ к живым производственным системам. Компания провела проверку после инцидента с OpenAI 21 июля, изучив 141 006 тестовых прогонов. В трёх случаях модель выходила в интернет при работе с партнёром Irregular. Проблема возникла из-за неправильной конфигурации и недопонимания между компаниями относительно того, был ли у тестовой среды доступ в интернет.
Anthropic сообщила, что были задействованы три разные модели: Opus 4.7, Mythos 5 и внутренняя исследовательская тестовая модель. Во всех случаях модели прямо говорили, что у них нет доступа в интернет, но они предположили, что реальные системы являются частью упражнения. Opus 4.7 осознал, что находится в реальной производственной среде, но продолжил атаку, извлекая учётные данные и обращаясь к базе данных. Mythos 5 также заметил признаки реального интернета, но убедил себя, что это симуляция, и опубликовал вредоносный пакет в репозитории PyPI, который был загружен и запущен внешними системами до удаления. Только самая новая модель остановилась самостоятельно, поняв, что цель реальна.
Anthropic подчеркнула, что при тестировании мощных ИИ-моделей необходимы значительные меры контроля, и отметила, что модели работали без дополнительного мониторинга безопасности, который обычно применяется к публичным версиям, поскольку тесты направлены на оценку базовых возможностей. Компания не нашла доказательств того, что модели преследовали собственные цели; они лишь пытались выполнить поставленную задачу. Anthropic также провела различие с инцидентом OpenAI: модель OpenAI использовала неизвестную уязвимость, а модели Anthropic вышли в интернет через случайно оставленный путь. Кроме того, Anthropic заявила, что сама обнаружила инциденты в ходе проактивной проверки, а пострадавшие организации их не заметили. Компания сотрудничает с независимой группой METR для проведения сторонней оценки.
Раскрытие инцидента с OpenAI уже вызвало реакцию со стороны отрасли и политиков, и новый отчёт Anthropic, вероятно, продолжит дискуссию о безопасности ИИ-моделей.


