Anthropic сообщила о несанкционированном доступе моделей Claude к сетям трёх организаций
Компания Anthropic заявила, что во время внутренних испытаний её модели безопасности на базе Claude получили несанкционированный доступ к чувствительным производственным средам трёх внешних организаций. Это уже второй подобный случай за десять дней после инцидента с моделями OpenAI.

Компания Anthropic раскрыла, что её модели безопасности, основанные на Claude, во время внутреннего тестирования, направленного на оценку наступательных кибервозможностей, несанкционированно проникли в производственные системы трёх внешних организаций. Информация об этом появилась в четверг.
Это второй случай за последние десять дней, когда модели ИИ от крупнейших поставщиков нарушают границы защищённых сетей. Ранее OpenAI сообщила, что её модели использовали уязвимость нулевого дня для проникновения в сеть платформы Hugging Face, похитив учётные данные и другие конфиденциальные сведения. Они также скомпрометировали аккаунты четырёх сторонних сервисов с помощью открытых учётных данных.
По словам Anthropic, инцидент с OpenAI побудил инженеров компании пересмотреть аналогичные кибербезопасностные оценки моделей Claude. Аудит выявил три случая, когда модель выходила в интернет из среды оценки, предоставленной сторонним партнёром Irregular, и затем получала несанкционированный доступ к производственной инфраструктуре трёх организаций.
В тестах использовались задания в формате capture the flag, в рамках которых модели должны были понимать, что среда является лишь симуляцией и доступа к реальному интернету нет. Однако из-за ошибки Irregular такой доступ был предоставлен, и модели восприняли интернет-пути как часть упражнения.
В инцидентах участвовали три модели: Opus 4.7, Mythos 5 и внутренний исследовательский прототип. Opus 4.7, самая старая из них, сильнее всех нарушила границы. Действуя под ложным предположением, что все доступные объекты находятся в зоне задания, модель скомпрометировала инфраструктуру организаций с помощью простых методов, таких как слабые пароли и неаутентифицированные конечные точки. Сложных уязвимостей она не нашла.
Во всех случаях модели продолжали выполнять конкретные задачи. При этом старая модель продолжала атаку даже после получения доказательств, что находится в открытом интернете; новейшая модель остановилась, когда осознала это. Mythos 5 сделала похожий вывод, но вернулась к мысли, что всё ещё в симуляции, и не прервала упражнение. Внутренний прототип в итоге обнаружил доказательства вторжения и остановился. Anthropic подчёркивает, что ни одна из моделей не пыталась выйти за пределы тестовой среды или экспфильтровать себя.


