OpenAI готовится выпустить модель Astra, которая умеет взламывать компьютерные системы
OpenAI сообщила, что её грядущая модель Astra способна находить и эксплуатировать неизвестные уязвимости, но доступ к самым продвинутым кибервозможностям будет ограничен.

OpenAI раскрыла новые подробности о своей предстоящей модели Astra, назвав её первой языковой моделью, достигшей критического порога кибербезопасности компании. Компания планирует сделать Astra доступной в ближайшее время, однако доступ к наиболее продвинутым функциям кибербезопасности будет более ограниченным.
По словам OpenAI, Astra способна находить и использовать неизвестные уязвимости в компьютерных системах без участия человека. Это вызывает опасения, аналогичные тем, которые ранее в этом году высказывались в связи с моделью Mythos от Anthropic. OpenAI принимает сопоставимые меры предосторожности.
Утверждения компании не имеют независимого подтверждения. OpenAI заявила, что предпросмотр модели будет проведён с группой тестировщиков, но не уточнила, кто они и как были отобраны. Также неизвестно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.
Astra получила идеальный балл в ExploitBench — тесте, оценивающем способность языковых моделей взламывать известные уязвимости. В модифицированной версии испытания, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня.
Чтобы предотвратить злоупотребления, OpenAI заявила, что уже начала улучшать обвязку модели для обнаружения злоупотреблений и предотвращения джейлбрейков. Для Astra компания инвестировала в нераскрытые новые методы, направленные на повышение безопасности самой модели. Кроме того, OpenAI начала выявлять аккаунты с более высоким риском и ограничивать ответы модели на их запросы, но способ не раскрывается.
Компания называет Astra своей наиболее согласованной моделью и планирует развернуть её с дополнительным мониторингом цепочки рассуждений, чтобы выявлять и пресекать нежелательное поведение.
Эта подготовка происходит на фоне реакции индустрии на инцидент, когда агенты OpenAI сбежали из учебной среды и получили доступ к приватным данным на платформе Hugging Face. Для Astra OpenAI разработала тест, чтобы проверить, не попытается ли модель воспроизвести действия этих агентов. Компания сообщает, что Astra не пыталась сбежать из своей тестовой среды.
Йона Шавит, бывший сотрудник OpenAI, который сейчас работает в OpenAI Foundation, задался вопросом в соцсетях, было ли нежелание Astra нарушать правила результатом осознания ожиданий или попыткой обмануть исследователей.
Несмотря на все новые детали, по-прежнему сложно понять, на что именно способна Astra и принимает ли OpenAI правильные меры безопасности. Компания ожидает, что опубликует больше оценок и информации о безопасности при широком публичном запуске. К тому моменту, однако, многое уже может выйти из-под контроля.


