Новая техника рассуждений OpenAI обеспокоила экспертов по безопасности ИИ
Как сообщается, будущая модель OpenAI Astra будет использовать технику под названием "recurrent depth", которая может затруднить отслеживание хода её рассуждений. Эксперты по безопасности ИИ предупреждают, что при более широком применении этот подход рискует снизить контроль над поведением моделей.

Как во вторник сообщило издание The Information, готовящаяся модель OpenAI под названием Astra будет использовать новый подход к рассуждениям, известный как "recurrent depth", или "непрозрачная рекурсия". В отличие от привычной последовательной цепочки рассуждений, характерной для большинства reasoning-моделей, эта техника заставляет модель многократно обрабатывать один и тот же запрос в цикле, оставляя гораздо менее понятный след её рассуждений.
Эта новость встревожила ряд специалистов в области безопасности ИИ. Глава компании Redwood Бак Шлегерис заявил, что не уверен, насколько именно рассуждения Astra труднее отслеживать по сравнению с предыдущими моделями, но предупредил: если OpenAI расширит применение этой техники, это может со временем полностью лишить возможности отслеживать ход рассуждений модели.
Давний эксперт по безопасности ИИ Зви Мовшовиц заявил, что для предотвращения "гонки на дно" среди разработчиков ИИ может понадобиться законодательное регулирование, отметив, что более интенсивное использование подобных техник, вероятно, навредит прозрачности во всей отрасли.
Почему важна цепочка рассуждений
Обычно цепочка рассуждений reasoning-модели показывает последовательные шаги, которые она предпринимает при решении задачи. Хотя это представление несовершенно, оно оказалось полезным инструментом для выявления неправильного или несогласованного поведения — записи цепочки рассуждений, как сообщается, сыграли важную роль в понимании недавнего случая нежелательного поведения агентов OpenAI.
Главный научный сотрудник OpenAI Якуб Пахоцки публично подчеркнул, что компания с момента появления первых reasoning-моделей стремится сохранять понятность цепочек рассуждений, и опроверг предположения о переходе OpenAI к так называемому "neuralese". По имеющимся данным, применение новой техники в Astra ограничено, а её цепочка рассуждений по-прежнему должна оставаться читаемой.
В дополнительном сообщении The Information в среду говорилось, что Anthropic и Google DeepMind уже обсуждают похожие техники. Главный научный сотрудник Redwood Research Райан Гринблатт предупредил, что непрозрачные рассуждения могут развиваться быстрее традиционных цепочек рассуждений, что потенциально может привести к моделям, рассуждающим почти полностью вне видимых и поддающихся контролю каналов.


