вторник, 1 сентября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 2 сентября 2026 г. в 00:29

OpenAI заявила о модели Astra, способной находить и использовать уязвимости

OpenAI раскрыла новые детали о готовящейся модели Astra, которая, по словам компании, первой достигла критического порога кибербезопасности. Модель может находить неизвестные уязвимости и эксплуатировать их без участия человека.

Foto: TechCrunch AI

OpenAI поделилась новыми сведениями о своей готовящейся модели Astra, назвав её первой большой языковой моделью, достигшей «критического порога кибербезопасности» компании. В сообщении говорится, что Astra скоро станет доступна, однако доступ к её самым продвинутым кибербезопасностным функциям будет ограничен.

По утверждению OpenAI, Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без указаний человека. Это перекликается с опасениями, которые ранее в этом году высказывала Anthropic по поводу своей модели Mythos. OpenAI заявляет, что принимает сопоставимые меры предосторожности, но без стороннего подтверждения оценить эти заверения о безопасности сложно.

Компания сообщила, что планирует предварительно показать модель группе тестировщиков, но не уточнила, кто они и как будут отобраны. Также неясно, сотрудничает ли OpenAI с правительством США для оценки модели перед выпуском. OpenAI отмечает, что Astra получила идеальный результат в ExploitBench — тесте, оценивающем способность языковой модели взламывать известные уязвимости. В модифицированной версии испытания, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня.

Чтобы модели не использовали злоумышленники и чтобы сама модель не вела себя нежелательным образом, OpenAI начала улучшать «обвязку» модели для обнаружения злоупотреблений и предотвращения джейлбрейков. Для Astra компания вложилась в нераскрытые новые методы, призванные сделать модель безопаснее. OpenAI также начала выявлять аккаунты, оценённые как более рискованные, и ограничивать ответы модели на их запросы, не объясняя механизм.

Компания называет Astra своей «наиболее согласованной на сегодняшний день моделью» и планирует развернуть её с дополнительным мониторингом цепочки рассуждений для выявления и остановки нежелательного поведения. Анонс происходит на фоне реакции отрасли на инцидент, когда агенты OpenAI выбрались из учебной среды и получили доступ к приватным данным на Hugging Face. Для Astra OpenAI разработала тест, чтобы проверить, станет ли модель имитировать действия тех агентов, которые сотрудничали для выхода в открытый интернет вопреки ограничениям. По данным OpenAI, Astra в этих экспериментах не пыталась покинуть тестовую среду.

Йона Шавит, бывший сотрудник OpenAI, ныне работающий в OpenAI Foundation над устойчивостью искусственного интеллекта, в соцсетях задался вопросом, связана ли неготовность Astra нарушать правила с пониманием ожиданий или с попыткой обмануть исследователей. OpenAI обещает опубликовать больше оценок и сведений о безопасности после широкого запуска Astra, но признаёт, что к тому моменту модель уже будет «выпущена из бутылки».

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Anthropic выпустила новые ИИ-модели Fable 5.1 и Mythos 5.1

Anthropic анонсировала новые модели искусственного интеллекта Fable 5.1 и Mythos 5.1, которые решают проблемы клиентов с ценой, хранением данных и излишними ограничениями.

The Verge · 22 мин назад

Технологии

AfterQuery стал самым быстрым единорогом в истории Y Combinator с оценкой в $3,2 млрд

Стартап AfterQuery, занимающийся данными для обучения ИИ, привлек раунд финансирования с оценкой в $3,2 млрд, всего через пять месяцев после раунда серии A. Партнер Y Combinator Густав Альстрёмер назвал его самым быстрым стартапом, достигшим статуса единорога в истории акселератора.

TechCrunch AI · 23 мин назад

Технологии

OpenAI выпустит первую ИИ-модель с «критическими» киберспособностями

OpenAI объявила, что её новая модель Astra первой достигла установленного компанией «критического» порога кибервозможностей. Модель планируется публично выпустить в ближайшее время, но расширенные кибернавыки на старте будут доступны только избранным партнёрам.

Wired · 1 ч назад