Новая техника рассуждений OpenAI встревожила экспертов по безопасности ИИ
Готовящаяся модель Astra от OpenAI будет использовать метод "непрозрачной рекуррентности", который затрудняет отслеживание хода её рассуждений. Эксперты по безопасности ИИ предупреждают, что расширение этой техники может серьёзно подорвать возможность контроля над поведением ИИ.

Как сообщило издание The Information во вторник, готовящаяся модель OpenAI под названием Astra будет использовать новый подход к рассуждениям — так называемую "рекуррентную глубину", или "непрозрачную рекуррентность". В отличие от обычных моделей, которые следуют последовательной цепочке рассуждений шаг за шагом, эта техника позволяет модели многократно обрабатывать один и тот же запрос в цикле, оставляя меньше понятных человеку следов.
Опасения экспертов
Эта новость обеспокоила ряд специалистов по безопасности ИИ. Глава Redwood Research Бак Шлегерис заявил, что глубоко встревожен сообщением, отметив, что пока не может оценить, насколько Astra менее поддаётся мониторингу по сравнению с предыдущими моделями, но предупредил: если OpenAI продолжит развивать эту технику, компания сможет резко увеличить рекуррентность и полностью лишить возможности отслеживать цепочку рассуждений.
Давний сторонник безопасности ИИ Зви Мовшовиц заявил, что может понадобиться законодательное регулирование, чтобы предотвратить "гонку на дно" среди лабораторий ИИ. По его словам, техника ставит под угрозу негласный принцип, который OpenAI и Anthropic стремились поддерживать — сохранять достоверность и прозрачность цепочки рассуждений как можно дольше.
Ответ OpenAI
Обычно цепочка рассуждений модели показывает последовательные шаги, которые она предпринимает при решении задачи. Хотя это представление несовершенно, оно служит полезным инструментом для выявления неправильного или несогласованного поведения — как сообщается, именно оно помогло объяснить прошлые случаи нежелательного поведения агентов OpenAI.
OpenAI заявляет, что использование этой техники в Astra ограничено и цепочка рассуждений модели останется понятной, отвергая предположения о переходе к полностью непрозрачному мышлению. Главный научный сотрудник компании Якуб Пахоцки подтвердил, что сохранение прозрачных и контролируемых цепочек рассуждений остаётся ключевым приоритетом исследований лаборатории.
В последующем отчёте The Information в среду говорилось, что Anthropic и Google DeepMind уже обсуждают похожие техники. Главный научный сотрудник Redwood Research Райан Гринблатт предупредил, что непрозрачные рассуждения могут развиваться быстрее традиционных цепочек мышления, что повышает риск появления моделей, рассуждающих почти полностью вне видимых человеку каналов.


