benchmarks

ARC-AGI-3 пройден целиком, 100,00 балла RHAE

Promtime

benchmarks

Кодинг-агент общего назначения NVIDIA AVO набрал 100,00 балла RHAE на ARC-AGI-3, интерактивном бенчмарке на рассуждения, и прошёл его целиком, без единого незакрытого уровня. Разбор архитектуры вышел в блоге NVIDIA для разработчиков 21 августа 2026 года, на результат обратили внимание в Threads.

Коротко

  • В ARC-AGI-3 агента помещают в пошаговые игры со скрытыми правилами и без инструкций, поэтому закономерности приходится выводить по ходу, опираясь на реакцию среды на каждое сделанное действие.
  • Результат складывается из 183 пройденных уровней в 25 средах ARC-AGI-3, причём действий в средах агент израсходовал на 12% меньше, чем VISTA, по данным разбора NVIDIA.
  • Базовый результат Claude Opus 5 на ARC-AGI-3 держится около 30%, поэтому NVIDIA подаёт полное прохождение как показатель того, что даёт агентная надстройка над моделью в длинных интерактивных задачах.

Интереснее самой цифры граница между моделью и обвязкой вокруг неё. ARC-AGI-3 проверяет способность выводить правила из взаимодействия со средой, и сильные базовые модели набирают на нём заметно меньше, поэтому полное прохождение выглядит как аргумент в пользу того, что длинные автономные задачи упираются в организацию цикла работы агента, в память и обратную связь от запуска кода. Переносится ли такой прирост на реальную инженерную работу, по одному бенчмарку судить рано.

Задания ARC-AGI-3 представляют собой пошаговые игры, правила которых агенту не сообщают: их приходится реконструировать через пробные ходы и отклик среды на каждое действие. Полный прогон AVO охватил 183 уровня в 25 средах. Итоговая оценка составила 100,00 балла RHAE.

По описанию NVIDIA, AVO работает непрерывным циклом: осматривает задачу, планирует, реализует решение и оценивает сделанное, опираясь на память, инструменты и обратную связь от исполнения кода. Накопленное на предыдущих шагах агент переносит дальше. Действий в средах на ARC-AGI-3 ему потребовалось на 12% меньше, чем VISTA.

Для сравнения в разборе приводится базовый результат Claude Opus 5 на ARC-AGI-3, около 30%. Ранее низкие показатели GPT-5.6 Sol на этом же бенчмарке в OpenAI объясняли обвязкой для запуска, а не самой моделью. Отметка Claude Opus 5 относится к базовому запуску модели без агентной надстройки.

Серия ARC-AGI задумывалась как проверка обобщения на незнакомых задачах, а третья версия перенесла её в интерактивный формат, где важна цепочка действий и выводов. NVIDIA относит AVO к кодинг-агентам общего назначения и описывает его как архитектуру фронтирного уровня для автономных агентов с длинным горизонтом задач.

Что не следует из разбора AVO

Сроков и условий, на которых AVO станет доступен за пределами NVIDIA, в разборе не называется. Открытым остаётся и практический вопрос о том, как результат на 25 игровых средах соотносится с работой над реальными репозиториями, где цена ошибки и длина контекста другие. Не называется и то, войдёт ли архитектура AVO в продукты NVIDIA для разработчиков.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.