NVIDIA AVO прошёл публичный ARC-AGI-3 на 100% — и показал, насколько важен агентный харнессNVIDIA протестировала свой агентный фреймворк
AVO на ARC-AGI-3 и получила максимальный результат на публичном наборе: агент прошёл все 183 уровня в 25 игровых средах и набрал 100,00 по метрике RHAE. Она учитывает не только успешность прохождения, но и эффективность действий относительно человека, впервые столкнувшегося с задачей. Всего AVO потребовалось 6 624 действия — примерно на 12% меньше, чем системе VISTA с той же Claude Opus 5, которой понадобилось 7 542.
ARC-AGI-3 заметно отличается от предыдущих версий бенчмарка. Вместо статических головоломок агент попадает в неизвестные интерактивные среды без описания правил и даже без явно сформулированной цели. Ему приходится экспериментировать, по результатам действий восстанавливать устройство мира, понимать, чего вообще требуется добиться, а затем планировать прохождение на десятки и сотни шагов вперёд. Именно поэтому ARC Prize позиционирует его как тест прежде всего для автономных агентов, а не изолированных языковых моделей.
AVO — Agentic Variation Operators — изначально создавался NVIDIA совсем для другой задачи: автономной оптимизации GPU-ядер. В отличие от обычного подхода, где LLM лишь генерирует очередной вариант решения внутри заранее заданного алгоритма поиска, в AVO модель сама решает, что исследовать, что изменить, какой эксперимент провести и как интерпретировать его результат. Состояние сохраняется между длинными циклами работы, а отдельный агент-наблюдатель отслеживает застой и может направить поиск в другую сторону. По сути, модель здесь выступает не отдельным генератором кода, а ядром длительного цикла «гипотеза → действие → проверка → корректировка».
На ARC-AGI-3 NVIDIA практически не меняла эту архитектуру, заменив лишь интерфейс к среде. Claude Opus 5 получала состояние игры не картинкой, а точной текстовой сеткой 64×64 и список доступных действий без объяснения их смысла. При этом команда сознательно не добавляла специализированную для ARC программную модель мира: задача состояла как раз в том, чтобы проверить переносимость универсального агентного цикла.
Именно переносимость NVIDIA считает главным результатом. Ранее AVO непрерывно работал семь дней над оптимизацией attention-ядер, исследовал более 500 направлений и сохранил 40 версий реализации. На DGX B200 лучшие варианты оказались до 3,5% быстрее cuDNN и до 10,5% быстрее FlashAttention-4, после чего агент примерно за полчаса самостоятельно адаптировал найденные решения под grouped-query attention. Теперь практически та же система смогла работать уже с совершенно другой задачей — неизвестными интерактивными мирами.
В NVIDIA отдельно подчёркивают, что результат нельзя трактовать как «AVO повысил Claude Opus 5 с 30% до 100%». ARC Prize действительно показывает для Claude Opus 5 около 30% в другой конфигурации, но отличаются режим рассуждений, харнесс и процедура оценки, поэтому это не контролируемое сравнение. Скорее эксперимент показывает более общий тезис: способности автономного агента определяются не только базовой моделью, но и системой вокруг неё — памятью, инструментами, управлением контекстом, обратной связью и механизмами выхода из тупиков.
Есть и важная оговорка: речь идёт именно о публичном наборе ARC-AGI-3, а не о скрытом наборе конкурсной оценки. NVIDIA прямо это отмечает. Более того, 100% на публичной версии уже получала система
Tycho в июле, поэтому результат AVO — не первое «решение ARC-AGI-3» вообще. ARC Prize также предупреждает, что результаты для публичного ARC-AGI-3 в Community Leaderboard обычно заявляются самими авторами и не проходят независимую проверку фонда.
Если свести работу к одной мысли, то AVO хорошо иллюстрирует нынешний сдвиг в агентных системах: длинный горизонт работы всё меньше выглядит свойством одной LLM и всё больше — свойством архитектуры, которая умеет накапливать опыт и превращать последовательные вызовы модели в единый непрерывный процесс решения задачи.