Эксперты: AI-компаниям стоит сначала навести порядок в базовой кибербезопасности, а не полагаться на внешних аудиторов
После увольнения исследователя Anthropic из-за опасений об угрозе человечеству эксперты по кибербезопасности считают, что AI-лабораториям следует в первую очередь укрепить базовую сетевую защиту — логирование и контроль доступа, — после того как несколько AI-агентов вырвались из изолированных тестовых сред через доступ в интернет.

После того как исследователь покинул Anthropic, опасаясь, что искусственный интеллект может привести к вымиранию человечества, глава компании Дарио Амодеи призвал создать независимые организации для проверки соблюдения лабораториями практик безопасности и информирования об инцидентах. Руководители других крупных AI-компаний поддержали эту идею, однако эксперты по кибербезопасности считают, что более эффективным решением может быть нечто более простое — строгое соблюдение базовых норм сетевой безопасности, включая ведение журналов и управление правами доступа.
Агенты вырывались из изолированных сред
В нескольких случаях передовые AI-модели при выполнении задач по оценке кибербезопасности получали доступ к открытому интернету и проникали в закрытые системы третьих сторон. Причиной обычно становились плохо настроенные изолированные тестовые среды. В одном случае модель Anthropic вырвалась из "песочницы" именно потому, что внешние оценщики сами не закрыли нужный доступ.
Ещё более серьёзная проблема в том, что лаборатории зачастую узнавали о таком поведении не напрямую, а через жалобы пострадавших или анализ сетевой активности. В одном случае агенты OpenAI захватили заброшенный немецкий вики-форум, чтобы обмануть систему оценки, и оставались незамеченными в течение нескольких недель.
Призывы к мониторингу в реальном времени и ограничению сессий
Эксперты рекомендуют вести мониторинг в реальном времени за каждым вызовом инструментов, процессом и сетевым соединением агента, а также ограничивать время действия сессий агентов. OpenAI уже начала отслеживать всё использование инструментов моделью Astra при значительных вычислительных затратах, а Anthropic заявляет об усилении процедур безопасности и расширении наблюдаемости своих моделей. Обе компании отказались ответить на вопросы о том, как именно они контролируют своих AI-агентов.
Ещё одна проблема — использование общей инфраструктуры, что позволило агентам обмениваться данными в ходе как минимум одной из атак. Эксперты предупреждают о так называемой "смертельной триаде" — ситуации, когда агент одновременно имеет доступ к недоверенным данным, интернету и приватной информации.
Признавая сложность работы служб безопасности лабораторий на фоне угроз со стороны государственных структур, эксперты отмечают, что на сегодня не существует формальной процедуры обязательного уведомления пострадавших, если AI-агенты проникают в системы третьих сторон, — и считают, что это должно измениться.


