Ученые Nvidia провели исследование и выяснили, что решающим фактором успеха ИИ-агента в длительных многоэтапных задачах становится не сама модель, а программная «обвязка» — набор инструментов, механизмов управления памятью и правил, превращающих модель в автономного агента.

В своих экспериментах специалисты компании использовали кастомную обвязку с усовершенствованным управлением памятью и отдельным компонентом-«супервизором», что позволило модели Claude Opus 5 показать 100% результат на тесте интерактивного мышления ARC-AGI-3 — наборе двухмерных игр без инструкций, где система должна самостоятельно разобраться в правилах и выиграть. Без специальной обвязки та же модель набрала лишь 30%, что при этом оставалось лучшим показателем среди всех протестированных моделей.
По словам вице-президента по продуктам подразделения ИИ Nvidia Аделя Эль Халлака, распространенное представление об агенте как об API модели ошибочно: агент включает саму модель, обвязку из используемых ею инструментов, среду выполнения и библиотеки навыков, к которым у нее есть доступ.
Задачи с длинным горизонтом планирования, требующие связывания множества решений на протяжении дней работы, остаются одной из главных нерешенных проблем в исследованиях автономных агентов. В апреле Microsoft протестировала 19 языковых моделей на подобных задачах редактирования документов и обнаружила, что все модели, включая самые современные, допускали множество ошибок.
Отмечались и случаи, когда автономные агенты удаляли пользовательские файлы и целые базы данных или прибегали к противоправным действиям, включая сговор и взлом систем.
Выбор именно теста ARC-AGI-3 исследователями Nvidia примечателен: этот бенчмарк ранее вызывал раздражение у компании OpenAI, чьи модели показывали на нем результат ниже 10%.
После публикации этих данных OpenAI провела собственное исследование и обнаружила, что настройка всего двух параметров обвязки утраивает результаты моделей — однако ни одна из них не приблизилась к 100%, достигнутым Nvidia.
Разработчики показали, что для такого результата обвязке необходим компонент-супервизор, направляющий агента в нужную сторону, если тот застревает в тупиковой ветке решения.
Эль Халлак сравнил роль супервизора с функцией руководителя, который подталкивает основного агента в правильном направлении, когда тот отклоняется от курса или повторно исследует уже пройденный путь.
Концепция контролирующего агента не нова, однако большинство пользователей сегодня применяют лишь один уровень обвязки, например Claude Code или Codex. Исследователи Nvidia разработали собственную усовершенствованную систему под названием Agentic Variation Operators.
Компания подчеркивает, что это не коммерческий продукт, а часть открытых наработок под брендом Nemo, которые Nvidia предоставляет разработчикам агентных систем.
Результаты Nvidia дополняют растущий массив данных о том, что выбор модели далеко не единственный фактор, влияющий на эффективность агентных систем. В июле компания Databricks опубликовала исследование, показавшее, что обвязка сильнее модели влияет на итоговую стоимость использования ИИ.
По словам генерального директора Databricks Али Годси, одна и та же модель при разных обвязках может обходиться в разы дороже, и удвоение расходов часто связано не с самой моделью, а с неудачным выбором окружения вокруг нее.
Эль Халлак подчеркнул, что открытые обвязки, как и открытые модели, дают пользователям больше контроля над системой, чем принято считать. По его словам, открытый стек агентных технологий — с контролем на уровне обвязки, инфраструктуры и среды выполнения — необходим для безопасного развития всей экосистемы, особенно на фоне случаев, когда автономные модели создавали угрозы безопасности при работе без должного контроля.
Подпишитесь на «Инк» в Telegram. Там мы пишем нескучным языком о самом важном для предпринимателей. Подписаться.