пятница, 28 августа 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 28 августа 2026 г. в 23:21

Исследователь Anthropic показал, как ИИ может сам улучшать свою безопасность

Anthropic опубликовала исследование, показывающее, что автоматизированные системы способны надёжно улучшать поведение ИИ-моделей по всем 10 проверенным показателям соответствия (alignment). Результаты говорят о том, что автоматизированные исследования безопасности ИИ могут в скором времени стать практически применимыми.

Foto: TechCrunch AI

В пятницу компания Anthropic опубликовала новую статью под названием "Automated Researchers Can Reliably Mitigate Alignment Failures", в которой показано, как автоматизированные системы способны улучшать поведение ИИ-моделей по десяти показателям, каждый из которых отражает конкретный тип нежелательного (несогласованного) поведения модели. Результаты улучшились по всем десяти показателям без снижения общей эффективности моделей.

Исследование возглавляет стипендиат программы Anthropic Chen Yueh-Han. Созданная система во многом повторяет традиционный процесс исследований: каждый автоматизированный агент изучает доступную литературу, предлагает метод и в течение 30 минут обучает модель с его использованием, постепенно улучшая показатели за несколько итераций. Эффективные методы сохраняются, неэффективные — отбрасываются, что позволяет процессу работать быстро и в большом масштабе.

Сравнение с людьми

Согласно статье, лучший автоматизированный метод в среднем превосходит предложения опытных исследователей-людей уже в течение шести часов, тогда как направления исследований, задаваемые людьми, не приводили к более сильным результатам. Авторы приводят и сравнение по стоимости: работа автоматизированного исследователя обходится примерно в 4 доллара в час на вычисления через API, тогда как исследователям-людям Anthropic платит 150 долларов в час.

Anthropic рассматривает эту работу как ранний шаг к так называемому рекурсивному самоулучшению — идее, что модели смогут со временем улучшать не только собственную безопасность, но и более широкие практики обучения, что, по мнению некоторых, может со временем снизить потребность в исследователях-людях.

В статье также отмечаются ограничения подхода. Он работает лишь в той мере, в какой используемые тесты действительно отражают реальные цели безопасности, а создание и поддержание таких тестов, как и расширение базы литературы, на которую опираются автоматизированные исследователи, по-прежнему требует значительных усилий.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Компания Lambda привлекла $1 млрд долга для закупки новых чипов Nvidia

AI-облачная компания Lambda привлекла 1 млрд долларов краткосрочного частного долга для покупки чипов Nvidia, которые планирует сдавать в аренду Microsoft — это очередной кредит компании на финансирование GPU-инфраструктуры.

TechCrunch · 1 ч назад

Технологии

Утечка версии NVIDIA DLSS 5 дала странные результаты в играх

В сети распространилась ранняя, незавершённая версия технологии DLSS 5 от NVIDIA, извлечённая из NBA 2K27 и применённая к другим играм с странным, пугающим визуальным эффектом. Утёкшая версия также заметно снижает производительность.

Engadget · 1 ч назад

Технологии

Исследователь Anthropic показал раннюю версию ИИ, способного самостоятельно улучшать согласованность моделей

Anthropic опубликовала исследование об автоматизированной системе, которая стабильно улучшает поведение ИИ-моделей по тестам согласованности, не снижая при этом общую производительность. Результаты рассматриваются как ранний шаг к ИИ, способному самостоятельно обучать и улучшать себя.

TechCrunch · 1 ч назад