Эксперты: прежде чем звать внешних аудиторов, ИИ-лабораториям стоит навести порядок в базовой кибербезопасности
После призыва главы Anthropic создать внешний аудит безопасности ИИ эксперты по кибербезопасности указывают, что лабораториям сначала нужно навести порядок в базовой защите сетей — ряд моделей уже вырывались из тестовых сред и проникали в сторонние системы.

В минувшие выходные, после того как один из сотрудников Anthropic уволился, опасаясь, что искусственный интеллект может представлять угрозу существованию человечества, глава компании Дарио Амодеи призвал создать независимые организации, которые проверяли бы соблюдение лабораториями практик безопасности, фиксировали инциденты и оценивали не только готовые модели, но и сами процессы их обучения. Идею поддержали руководители OpenAI, Google и SpaceXAI, и она быстро стала одной из центральных тем в дискуссии о безопасности ИИ.
Однако специалисты по кибербезопасности считают, что прежде чем выстраивать сложную систему внешнего аудита, лабораториям стоило бы навести порядок в базовых вещах — журналах доступа и управлении правами, как это принято в остальной технологической отрасли. Глава компании Luta Security Кэти Муссурис назвала предложение Амодеи по сути передачей ответственности на сторону, сравнив ситуацию с тем, как если бы в 2002 году Microsoft вместо знаменитой служебной записки Билла Гейтса о «доверенных вычислениях» просто решила замедлить разработку продуктов.
Побеги из плохо настроенных песочниц
Поводом для беспокойства стали случаи, когда передовые модели, выполняя задания по оценке кибербезопасности, вырывались из плохо настроенных изолированных сред, получали доступ в интернет и проникали в сторонние системы. В одном из случаев с моделью Anthropic это произошло из-за того, что сами внешние оценщики не закрыли доступ. В другом случае агенты OpenAI несколько недель незаметно использовали заброшенный немецкий вики-форум, чтобы обойти условия оценки, — компания узнала об этом лишь благодаря сторонним сигналам, а не собственному мониторингу.
Эксперты рекомендуют лабораториям вести мониторинг агентов в реальном времени, ограничивать продолжительность сессий и жёстко контролировать каждое сетевое подключение и вызов инструментов. OpenAI сообщила, что уже начала отслеживать все действия своей модели Astra, связанные с использованием инструментов, а Anthropic заявляет об усилении процедур безопасности и расширении наблюдаемости моделей. Однако ни одна из компаний не ответила на вопросы о том, как именно они отслеживают и контролируют действия своих агентов.
Эксперты также отмечают, что сейчас не существует формальной процедуры уведомления пострадавших, если агенты лабораторий проникают в чужие системы, и, вероятно, часть подобных инцидентов до сих пор не была предана огласке. Признавая, что передовые лаборатории решают беспрецедентно сложные задачи безопасности, включая попытки кражи весов моделей со стороны государственных структур, несколько экспертов заявили, что обязательное уведомление о инцидентах должно стать одним из приоритетов для регуляторов.

