openai

GPT-6 Astra набрала 99,9% в ARC-AGI-3

Promtime

openai

GPT-6 Astra набрала 99,9% на полузакрытом наборе ARC-AGI-3 в обвязке Provider Adapter при уровне рассуждений high и затратах 18 817 долларов. Об этом сообщает ARC Prize, который ведёт серию бенчмарков ARC-AGI. В стандартной обвязке лучший результат Astra составил 62,7% при уровне рассуждений max и затратах 26 098 долларов.

Коротко

  • Стандартная обвязка даёт модели только видимые заметки, которые она сама решает сохранить, а Provider Adapter удерживает скрытое состояние рассуждений между запросами и сжимает длинные диалоги для повторного использования работы.
  • В прогонах Provider Adapter результаты держатся в диапазоне от 96,7% до 99,9% при затратах от 17 332 до 23 457 долларов, тогда как в стандартной обвязке разброс составляет от 17,5% до 62,7%.
  • В отдельной обвязке PRO-LONG с песочницей для запуска кода Astra писала для каждой игры парсеры поля, модели состояния, поисковые алгоритмы и планировщики, вплоть до небольших библиотек под конкретную игру.

Разрыв между двумя обвязками, 62,7% в стандартной и почти полное решение через Provider Adapter, показывает, насколько результат на агентных бенчмарках зависит от инфраструктуры контекста, а не только от самой модели. Судя по всему, сравнение моделей разных поставщиков теперь требует двух чисел вместо одного. Для практиков это означает, что перенос агента между API может стоить десятков процентных пунктов качества при той же модели.

Provider Adapter оказался примерно в 3,66 раза быстрее и потратил на 49% меньше токенов

По данным ARC Prize, прогоны в Provider Adapter суммарно оказались примерно в 3,66 раза быстрее по записанному времени и использовали на 49% меньше токенов на 167 парах «игра и уровень рассуждений», решённых обеими обвязками. Сравнение охватывает публичный и полузакрытый наборы и все уровни рассуждений.

Более высокие уровни рассуждений в среднем обходятся дешевле: в стандартной обвязке уровень max стоил 26 098 долларов против 49 791 доллара на уровне none, поскольку Astra решает игры за меньшее число действий и делает меньше вызовов модели. В Provider Adapter та же картина: 17 332 доллара на max против 23 457 долларов на none.

ARC Prize сообщает, что впредь в таблице лидеров ARC-AGI будут публиковаться результаты обеих обвязок с явной пометкой условий оценки. Открытый репозиторий тестирования и документ о политике тестирования описывают оба подхода. Стандартная обвязка задумана как минимальный нейтральный интерфейс, одинаковый для всех поставщиков.

Astra (max) прошла 96,0% уровней меньшим числом действий, чем медианный человек

Перед запуском ARC-AGI-3 ARC Prize протестировал около 500 представителей широкой публики, не отбирая их по опыту решения головоломок. Базовой линией для каждого уровня стало медианное число действий среди тех, кто его прошёл. Люди решают 100% сред бенчмарка, сложность которых откалибрована в контролируемых тестах.

В обвязке Provider Adapter Astra на уровне max использовала меньше действий, чем базовая линия, на 96,0% уровней и в среднем тратила на уровень на 51,7% меньше действий. ARC Prize называет это достижением паритета с человеком по метрике эффективности действий и подчёркивает, что бенчмарк измеряет не только прохождение среды.

В контролируемом тестировании участникам платили 115 долларов за сессию в 90 минут и по 5 долларов за пройденную игру, при примерно девяти играх за сессию это около 12,78 доллара за попытку. Если считать только энергию мозга по цене электричества, ARC Prize оценивает сессию примерно в 0,6 цента, или 0,067 цента за попытку игры.

В игре tu93 Astra написала четыре собственных модуля под механику среды

Astra сама выбирает, какие заметки нести дальше по среде, и фиксирует объекты, координаты, правила и незавершённые планы. Для этого она порождает собственную короткую нотацию: запись вида «extend8 to3; retract10 to2; shorten8 to1» задаёт порядок изменений механизмов, а «rotate=(49,18)» связывает операцию с координатами управляющего элемента.

В обвязке PRO-LONG, где у модели был доступ к песочнице для запуска кода, Astra в игре tu93 с охраной и подвижными патрулями начала с навигации и написала maze_solver.py, затем добавила правила боя в combat_solver.py, модель патрулей в patrol_solver.py и сверку предсказаний с наблюдениями в sync_state.py.

ARC Prize подчёркивает, что условия PRO-LONG отличаются от контролируемого тестирования людей: у участников не было ни интерпретатора кода, ни блокнота для записей, поэтому результаты в этой обвязке следует читать как совместную работу модели и её инструментов. Попыток выйти за пределы песочницы зафиксировано не было.

Каким будет следующее поколение ARC-AGI

ARC Prize не называет результат Astra доказательством достижения AGI и отмечает, что среды ARC-AGI-3 детерминированы, замкнуты и ограничены по формату, то есть не отражают открытости реального мира. Организация сообщает, что прорабатывает вопросы для следующего поколения бенчмарков, включая оценку рекурсивного самоулучшения и открытой инновации. Сроки выхода нового поколения публично не называются.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.