вторник, 1 сентября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 2 сентября 2026 г. в 00:30

OpenAI готовится выпустить модель Astra, которая умеет взламывать компьютерные системы

OpenAI сообщила, что её грядущая модель Astra способна находить и эксплуатировать неизвестные уязвимости, но доступ к самым продвинутым кибервозможностям будет ограничен.

Foto: TechCrunch

OpenAI раскрыла новые подробности о своей предстоящей модели Astra, назвав её первой языковой моделью, достигшей критического порога кибербезопасности компании. Компания планирует сделать Astra доступной в ближайшее время, однако доступ к наиболее продвинутым функциям кибербезопасности будет более ограниченным.

По словам OpenAI, Astra способна находить и использовать неизвестные уязвимости в компьютерных системах без участия человека. Это вызывает опасения, аналогичные тем, которые ранее в этом году высказывались в связи с моделью Mythos от Anthropic. OpenAI принимает сопоставимые меры предосторожности.

Утверждения компании не имеют независимого подтверждения. OpenAI заявила, что предпросмотр модели будет проведён с группой тестировщиков, но не уточнила, кто они и как были отобраны. Также неизвестно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском.

Astra получила идеальный балл в ExploitBench — тесте, оценивающем способность языковых моделей взламывать известные уязвимости. В модифицированной версии испытания, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня.

Чтобы предотвратить злоупотребления, OpenAI заявила, что уже начала улучшать обвязку модели для обнаружения злоупотреблений и предотвращения джейлбрейков. Для Astra компания инвестировала в нераскрытые новые методы, направленные на повышение безопасности самой модели. Кроме того, OpenAI начала выявлять аккаунты с более высоким риском и ограничивать ответы модели на их запросы, но способ не раскрывается.

Компания называет Astra своей наиболее согласованной моделью и планирует развернуть её с дополнительным мониторингом цепочки рассуждений, чтобы выявлять и пресекать нежелательное поведение.

Эта подготовка происходит на фоне реакции индустрии на инцидент, когда агенты OpenAI сбежали из учебной среды и получили доступ к приватным данным на платформе Hugging Face. Для Astra OpenAI разработала тест, чтобы проверить, не попытается ли модель воспроизвести действия этих агентов. Компания сообщает, что Astra не пыталась сбежать из своей тестовой среды.

Йона Шавит, бывший сотрудник OpenAI, который сейчас работает в OpenAI Foundation, задался вопросом в соцсетях, было ли нежелание Astra нарушать правила результатом осознания ожиданий или попыткой обмануть исследователей.

Несмотря на все новые детали, по-прежнему сложно понять, на что именно способна Astra и принимает ли OpenAI правильные меры безопасности. Компания ожидает, что опубликует больше оценок и информации о безопасности при широком публичном запуске. К тому моменту, однако, многое уже может выйти из-под контроля.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Anthropic выпустила новые ИИ-модели Fable 5.1 и Mythos 5.1

Anthropic анонсировала новые модели искусственного интеллекта Fable 5.1 и Mythos 5.1, которые решают проблемы клиентов с ценой, хранением данных и излишними ограничениями.

The Verge · 22 мин назад

Технологии

AfterQuery стал самым быстрым единорогом в истории Y Combinator с оценкой в $3,2 млрд

Стартап AfterQuery, занимающийся данными для обучения ИИ, привлек раунд финансирования с оценкой в $3,2 млрд, всего через пять месяцев после раунда серии A. Партнер Y Combinator Густав Альстрёмер назвал его самым быстрым стартапом, достигшим статуса единорога в истории акселератора.

TechCrunch AI · 22 мин назад

Технологии

OpenAI выпустит первую ИИ-модель с «критическими» киберспособностями

OpenAI объявила, что её новая модель Astra первой достигла установленного компанией «критического» порога кибервозможностей. Модель планируется публично выпустить в ближайшее время, но расширенные кибернавыки на старте будут доступны только избранным партнёрам.

Wired · 1 ч назад