openai

Отключённые рассуждения дали Astra 96,7% на ARC-AGI-3

Promtime

openai

ARC Prize опубликовал таблицу результатов GPT-6 Astra на ARC-AGI-3: модель получила 62,7% в стандартной обвязке и 99,9% через Provider Adapter OpenAI, хотя речь идёт об одних весах. Как сообщает Thenextweb, OpenAI использовала второй показатель, объявляя начало эры AGI.

Коротко

  • Стандартная обвязка ARC Prize даёт всем участникам одинаковый минимальный интерфейс и оставляет модели выбор заметок между запросами; Provider Adapter сохраняет непрозрачное состояние рассуждений и сжимает длинные диалоги.
  • При уровне high reasoning адаптер получил 99,9% за 18 817 долларов, тогда как maximum reasoning в стандартной обвязке дал 62,7% при стоимости 26 098 долларов в одном запуске.
  • Показатель 99,9% сопоставляли с 7,8% у GPT-5.6 Sol, хотя второй результат получен в стандартной обвязке; сопоставимое сравнение на ARC-AGI-3 составляет 62,7% против 7,8%.

Разница между результатом модели и результатом собранной вокруг неё системы меняет смысл публичных сравнений. Судя по этим данным, единый тест без одинаковой обвязки измеряет одновременно способности весов, управление контекстом и доступные инструменты. Вероятно, отчётность по двум режимам станет минимальным условием, чтобы разработчики могли отделить прирост модели от эффективности сервиса, в котором она запущена, и повторить проверку независимо.

Provider Adapter дал 99,9% при меньшей стоимости запуска

В стандартной обвязке ARC Prize Astra на maximum reasoning решила 62,7% задач, а стоимость запуска составила 26 098 долларов. Через Provider Adapter OpenAI при high reasoning результат достиг 99,9%, а стоимость составила 18 817 долларов. В этой серии запусков более высокий результат оказался одновременно дешевле.

При отключённых рассуждениях внутри адаптера Astra набрала 96,7%. Этот режим превзошёл максимум рассуждений в стандартной обвязке на 34 пункта. Обе конфигурации решили 167 пар игровых задач: для них ARC Prize зафиксировал у запусков через адаптер на 49% меньше токенов и скорость примерно в 3,66 раза выше.

ARC Prize не признал 99,9% доказательством AGI

Фонд прямо заявил, что не называет результат AGI. Сооснователь ARC Prize Майк Кнуп написал, что доказательств для такого вывода пока недостаточно. В дальнейшем фонд намерен публиковать результаты стандартной обвязки и Provider Adapter рядом, чтобы различие конфигураций оставалось видимым.

Внутри материалов ARC Prize есть ещё одно расхождение: Франсуа Шолле указал в публикации 66% для стандартной обвязки, тогда как в таблице стоит 62,7%. Блог фонда назван первичной записью. Ранее и собственное освещение запуска сопоставляло 99,9% Astra с 7,8% Sol без оговорки о разных обвязках.

Fortune обнаружил, что после публикации в посте OpenAI менялись пять метрик. Галлюцинации Astra сначала оценивались в 4,2%, затем в 2%, а позднее вернулись к 4,2%; у Anthropic Fable 5.1 FrontierMath менялся с 87,8% до 78%, затем до 83%. Показатель Sol на ExploitBench вырос с 5,5% до 11,5%, хотя последний режим рассуждений коммерчески недоступен; OpenAI сообщила Fortune, что изучает возврат этой цифры.

Независимые тесты ставят Astra рядом с другими ведущими моделями

Artificial Analysis поставил Astra 67 баллов в Coding Agent Index в Codex, на уровень Claude Opus 5 и Fable 5; Fable 5.1 получил 70. В Intelligence Index Astra набрала 61 балл, столько же, сколько заменяемая модель, и на пять меньше Fable 5.1. Цена Astra составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных.

По подсчётам Artificial Analysis, при максимальном усилии задача на Astra обходится на 75% дороже, чем на Sol. Галлюцинации на собственном тесте знаний снизились с 92% до 51%, а длинные задачи по работе со знаниями прибавили около 80 Elo. Экономически взвешенный тест задач потерял примерно столько же, с регрессиями в банковской поддержке, научном Python и длинном контексте.

На следующий день Artificial Analysis перестроил индекс в версии 4.2, добавив более сложные задания и больше закрытых тестов, которые, по объяснению фирмы, нужны против подгонки. Стэнфордские исследователи Анка Ройель и Майк Харди называют повторные запуски ради лучшей цифры benchmaxxing. Они также указали, что описание внутреннего теста галлюцинаций почти не содержит методики и даже числа тестовых примеров.

Две строки ARC Prize В OpenAI не скрывают, что адаптер опирается на документированные возможности API, доступные разработчикам. Однако 99,9% получила собранная система, тогда как продаётся отдельная модель. ARC Prize намерен показывать оба режима параллельно; такая практика даст возможность отделять наблюдаемый результат обвязки от того, что можно независимо проверить у самих весов.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.

Отключённые рассуждения дали Astra 96,7% на ARC-AGI-3 · News