Исследователь Anthropic показал, как ИИ может сам улучшать свою безопасность
Anthropic опубликовала исследование, показывающее, что автоматизированные системы способны надёжно улучшать поведение ИИ-моделей по всем 10 проверенным показателям соответствия (alignment). Результаты говорят о том, что автоматизированные исследования безопасности ИИ могут в скором времени стать практически применимыми.

В пятницу компания Anthropic опубликовала новую статью под названием "Automated Researchers Can Reliably Mitigate Alignment Failures", в которой показано, как автоматизированные системы способны улучшать поведение ИИ-моделей по десяти показателям, каждый из которых отражает конкретный тип нежелательного (несогласованного) поведения модели. Результаты улучшились по всем десяти показателям без снижения общей эффективности моделей.
Исследование возглавляет стипендиат программы Anthropic Chen Yueh-Han. Созданная система во многом повторяет традиционный процесс исследований: каждый автоматизированный агент изучает доступную литературу, предлагает метод и в течение 30 минут обучает модель с его использованием, постепенно улучшая показатели за несколько итераций. Эффективные методы сохраняются, неэффективные — отбрасываются, что позволяет процессу работать быстро и в большом масштабе.
Сравнение с людьми
Согласно статье, лучший автоматизированный метод в среднем превосходит предложения опытных исследователей-людей уже в течение шести часов, тогда как направления исследований, задаваемые людьми, не приводили к более сильным результатам. Авторы приводят и сравнение по стоимости: работа автоматизированного исследователя обходится примерно в 4 доллара в час на вычисления через API, тогда как исследователям-людям Anthropic платит 150 долларов в час.
Anthropic рассматривает эту работу как ранний шаг к так называемому рекурсивному самоулучшению — идее, что модели смогут со временем улучшать не только собственную безопасность, но и более широкие практики обучения, что, по мнению некоторых, может со временем снизить потребность в исследователях-людях.
В статье также отмечаются ограничения подхода. Он работает лишь в той мере, в какой используемые тесты действительно отражают реальные цели безопасности, а создание и поддержание таких тестов, как и расширение базы литературы, на которую опираются автоматизированные исследователи, по-прежнему требует значительных усилий.

