Исследование Nvidia: результаты ИИ-агентов определяет не модель, а окружающая система
Специалисты Nvidia выяснили, что при использовании специальной вспомогательной системы модель Claude Opus 5 показала стопроцентный результат в сложном игровом тесте — против 30% без неё. Это говорит о том, что так называемый «harness» может быть важнее самой модели.

В пятницу компания Nvidia опубликовала исследование, согласно которому в длительных задачах для ИИ большее значение имеет не сама языковая модель, а система, построенная вокруг неё — так называемый «harness». Используя специальную систему с улучшенной обработкой памяти и добавив компонент-«супервайзер», исследователи добились того, что модель Claude Opus 5 набрала 100% в тесте ARC-AGI-3. Этот тест состоит из простых двухмерных игр без инструкций и считается сложным даже для ведущих моделей — успех означает, что модель самостоятельно разобралась, как играть и побеждать.
Без дополнительной системы та же модель показала лишь 30% — лучший результат среди всех протестированных моделей, но значительно ниже идеального.
Вице-президент по продукту в подразделении ИИ Nvidia Адель Эль Халлак пояснил, что агент — это не просто интерфейс к модели, а сама модель вместе с окружающими её инструментами, средой выполнения и навыками. Особенно важным оказался супервизирующий агент, который следит за работой основного агента и направляет его, если тот застревает, заходит в тупик или повторяет уже пройденный путь.
Rанее OpenAI была обеспокоена тем, что её модели набирали менее 10% в этом же тесте. В прошлом месяце компания провела собственное исследование и обнаружила, что изменение всего двух настроек системы утроило результаты её моделей, однако ни одна из них не приблизилась к стопроцентному результату Nvidia.
Система Nvidia под названием Agentic Variation Operators не является отдельным коммерческим продуктом, а входит в состав открытых инструментов бренда Nemo. К похожим выводам в июле пришла и компания Databricks: её глава Али Годси отметил, что выбор неподходящей системы для одной и той же модели может удвоить расходы на использование ИИ.
Эль Халлак подчеркнул, что открытые, настраиваемые системы дают пользователям гораздо больше контроля над точностью и безопасностью, чем принято считать, по сравнению с закрытыми решениями.


