пятница, 28 августа 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 28 августа 2026 г. в 23:22

Исследователь Anthropic показал раннюю версию ИИ, способного самостоятельно улучшать согласованность моделей

Anthropic опубликовала исследование об автоматизированной системе, которая стабильно улучшает поведение ИИ-моделей по тестам согласованности, не снижая при этом общую производительность. Результаты рассматриваются как ранний шаг к ИИ, способному самостоятельно обучать и улучшать себя.

Foto: TechCrunch

В пятницу исследователь программы стипендиатов Anthropic опубликовал статью под названием "Automated Researchers Can Reliably Mitigate Alignment Failures", описывающую автоматизированную систему для улучшения поведения ИИ-моделей в тестах на согласованность (alignment). Проект возглавил сотрудник Anthropic Чен Юэ-Хань (Chen Yueh-Han).

Систему протестировали на десяти отдельных тестовых наборах, каждый из которых измеряет конкретный тип несогласованного поведения модели. Автоматизированный подход смог улучшить показатели по всем десяти тестам, не снизив при этом общую производительность моделей.

Как работает процесс

Система во многом повторяет традиционный процесс научного исследования: она изучает доступную литературу, предлагает метод обучения, а затем обучает модель этим методом примерно 30 минут, постепенно повышая показатели за несколько итераций. Эффективные методы сохраняются, а неэффективные отбрасываются, что позволяет процессу работать быстро и в больших масштабах.

Авторы статьи называют результаты ранним доказательством того, что автоматизированное обучение согласованности может стать практически применимым в ближайшем будущем. Работу рассматривают как шаг к так называемому рекурсивному самоулучшению — идее о том, что ИИ-системы смогут со временем сами улучшать процесс собственного обучения.

Сравнение с людьми

В статье напрямую сравнивается производительность так называемого автоматизированного исследователя согласованности (AAR) с работой людей-экспертов. По данным авторов, лучший метод AAR в среднем в течение шести часов превосходит предложения опытных исследователей-людей, а направления исследований, заданные людьми, не приводили к более сильным результатам.

В статье приведено и сравнение затрат: работа AAR обходится примерно в 4 доллара в час за использование API, тогда как исследователям-людям компания платит около 150 долларов в час.

Авторы также признают ограничения подхода. Полезность автоматизированной системы зависит от того, насколько выбранные тесты действительно отражают реальные цели согласованности, а кроме того, требуется значительная работа по созданию и поддержке этих тестов, а также по расширению базы литературы, на которую опираются автоматизированные исследователи.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Компания Lambda привлекла $1 млрд долга для закупки новых чипов Nvidia

AI-облачная компания Lambda привлекла 1 млрд долларов краткосрочного частного долга для покупки чипов Nvidia, которые планирует сдавать в аренду Microsoft — это очередной кредит компании на финансирование GPU-инфраструктуры.

TechCrunch · 1 ч назад

Технологии

Утечка версии NVIDIA DLSS 5 дала странные результаты в играх

В сети распространилась ранняя, незавершённая версия технологии DLSS 5 от NVIDIA, извлечённая из NBA 2K27 и применённая к другим играм с странным, пугающим визуальным эффектом. Утёкшая версия также заметно снижает производительность.

Engadget · 1 ч назад

Технологии

Исследователь Anthropic показал, как ИИ может сам улучшать свою безопасность

Anthropic опубликовала исследование, показывающее, что автоматизированные системы способны надёжно улучшать поведение ИИ-моделей по всем 10 проверенным показателям соответствия (alignment). Результаты говорят о том, что автоматизированные исследования безопасности ИИ могут в скором времени стать практически применимыми.

TechCrunch AI · 2 ч назад