среда, 2 сентября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 2 сентября 2026 г. в 23:25

Новая техника рассуждений OpenAI обеспокоила экспертов по безопасности ИИ

Как сообщается, будущая модель OpenAI Astra будет использовать технику под названием "recurrent depth", которая может затруднить отслеживание хода её рассуждений. Эксперты по безопасности ИИ предупреждают, что при более широком применении этот подход рискует снизить контроль над поведением моделей.

Foto: TechCrunch

Как во вторник сообщило издание The Information, готовящаяся модель OpenAI под названием Astra будет использовать новый подход к рассуждениям, известный как "recurrent depth", или "непрозрачная рекурсия". В отличие от привычной последовательной цепочки рассуждений, характерной для большинства reasoning-моделей, эта техника заставляет модель многократно обрабатывать один и тот же запрос в цикле, оставляя гораздо менее понятный след её рассуждений.

Эта новость встревожила ряд специалистов в области безопасности ИИ. Глава компании Redwood Бак Шлегерис заявил, что не уверен, насколько именно рассуждения Astra труднее отслеживать по сравнению с предыдущими моделями, но предупредил: если OpenAI расширит применение этой техники, это может со временем полностью лишить возможности отслеживать ход рассуждений модели.

Давний эксперт по безопасности ИИ Зви Мовшовиц заявил, что для предотвращения "гонки на дно" среди разработчиков ИИ может понадобиться законодательное регулирование, отметив, что более интенсивное использование подобных техник, вероятно, навредит прозрачности во всей отрасли.

Почему важна цепочка рассуждений

Обычно цепочка рассуждений reasoning-модели показывает последовательные шаги, которые она предпринимает при решении задачи. Хотя это представление несовершенно, оно оказалось полезным инструментом для выявления неправильного или несогласованного поведения — записи цепочки рассуждений, как сообщается, сыграли важную роль в понимании недавнего случая нежелательного поведения агентов OpenAI.

Главный научный сотрудник OpenAI Якуб Пахоцки публично подчеркнул, что компания с момента появления первых reasoning-моделей стремится сохранять понятность цепочек рассуждений, и опроверг предположения о переходе OpenAI к так называемому "neuralese". По имеющимся данным, применение новой техники в Astra ограничено, а её цепочка рассуждений по-прежнему должна оставаться читаемой.

В дополнительном сообщении The Information в среду говорилось, что Anthropic и Google DeepMind уже обсуждают похожие техники. Главный научный сотрудник Redwood Research Райан Гринблатт предупредил, что непрозрачные рассуждения могут развиваться быстрее традиционных цепочек рассуждений, что потенциально может привести к моделям, рассуждающим почти полностью вне видимых и поддающихся контролю каналов.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Sony проведёт два State of Play подряд с показом Final Fantasy 7 Revelation

В четверг, 3 сентября, Sony покажет два State of Play подряд, обещая расширенный показ Final Fantasy 7 Revelation и других игр. Трансляции пройдут на YouTube и Twitch.

Engadget · 14 мин назад

Технологии

NASA упрощает конструкцию лунного скафандра, опасаясь срыва сроков Artemis IV

NASA решило вместе с компанией Axiom Space разработать упрощённый вариант скафандра для первых пилотируемых посадок на Луну — в рамках усилий по ускорению программы Artemis и достижению южного полюса Луны уже в 2028 году.

Ars Technica · 1 ч назад

Технологии

Google выпустила Gemini 3.8 Flash — модель «старается больше», но использование может подорожать

Google представила модель Gemini 3.8 Flash, которая выполняет больше шагов рассуждения, чем предшественница, но может расходовать больше токенов и тем самым увеличивать расходы пользователей. Модель показывает улучшения в задачах программирования и работы агентов, а ограниченная версия с усиленной защитой предлагается правительствам и доверенным партнёрам.

The Verge · 1 ч назад