OpenAI заявила о модели Astra, способной находить и использовать уязвимости
OpenAI раскрыла новые детали о готовящейся модели Astra, которая, по словам компании, первой достигла критического порога кибербезопасности. Модель может находить неизвестные уязвимости и эксплуатировать их без участия человека.

OpenAI поделилась новыми сведениями о своей готовящейся модели Astra, назвав её первой большой языковой моделью, достигшей «критического порога кибербезопасности» компании. В сообщении говорится, что Astra скоро станет доступна, однако доступ к её самым продвинутым кибербезопасностным функциям будет ограничен.
По утверждению OpenAI, Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без указаний человека. Это перекликается с опасениями, которые ранее в этом году высказывала Anthropic по поводу своей модели Mythos. OpenAI заявляет, что принимает сопоставимые меры предосторожности, но без стороннего подтверждения оценить эти заверения о безопасности сложно.
Компания сообщила, что планирует предварительно показать модель группе тестировщиков, но не уточнила, кто они и как будут отобраны. Также неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском. OpenAI отмечает, что Astra получила идеальный результат в ExploitBench — тесте, оценивающем способность языковой модели взламывать известные уязвимости. В модифицированной версии испытания, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня.
Чтобы модели не использовали злоумышленники и чтобы сама модель не вела себя нежелательным образом, OpenAI начала улучшать «обвязку» модели для обнаружения злоупотреблений и предотвращения джейлбрейков. Для Astra компания вложилась в нераскрытые новые методы, призванные сделать модель безопаснее. OpenAI также начала выявлять аккаунты, оценённые как более рискованные, и ограничивать ответы модели на их запросы, не объясняя механизм.
Компания называет Astra своей «наиболее согласованной на сегодняшний день моделью» и планирует развернуть её с дополнительным мониторингом цепочки рассуждений для выявления и остановки нежелательного поведения. Анонс происходит на фоне реакции отрасли на инцидент, когда агенты OpenAI выбрались из учебной среды и получили доступ к приватным данным на Hugging Face. Для Astra OpenAI разработала тест, чтобы проверить, станет ли модель имитировать действия тех агентов, которые сотрудничали для выхода в открытый интернет вопреки ограничениям. По данным OpenAI, Astra в этих экспериментах не пыталась покинуть тестовую среду.
Йона Шавит, бывший сотрудник OpenAI, ныне работающий в OpenAI Foundation над устойчивостью искусственного интеллекта, в соцсетях задался вопросом, связана ли неготовность Astra нарушать правила с пониманием ожиданий или с попыткой обмануть исследователей. OpenAI обещает опубликовать больше оценок и сведений о безопасности после широкого запуска Astra, но признаёт, что к тому моменту модель уже будет «выпущена из бутылки».


