anthropic

Два верхних режима Claude Fable 5.1 дают 90% на ARC-AGI-2

Claude News

anthropic

ARC Prize опубликовала проверенные результаты Claude Fable 5.1: на максимальном уровне рассуждений модель набирает 97,5% на ARC-AGI-1 Semi-Private при цене 1,40 доллара за задачу и 90,0% на ARC-AGI-2 Semi-Private при 4,49 доллара за задачу. Проверка датирована 1 сентября 2026 года и охватывает пять режимов рассуждений, от Low до Max.

Коротко

  • Пять режимов рассуждений дают на ARC-AGI-2 Semi-Private от 78,3% на Low до 90,0% на Max, причём XHigh показывает те же 90,0%, что и максимальный уровень.
  • На ARC-AGI-1 Semi-Private режимы идут плотнее: 90,0% на Low, 94,5% на Medium, 96,0% на High, 96,5% на XHigh и 97,5% на Max, то есть между двумя верхними ступенями ровно один процентный пункт.
  • ARC Prize выложила пройденные и проваленные задачи по каждому из пяти режимов для публичных наборов: 120 задач в ARC-AGI-2 Public Eval и 400 задач в ARC-AGI-1 Public Eval.

Совпадение Max и XHigh на ARC-AGI-2 выглядит как потолок конкретного набора: дополнительный бюджет рассуждений на верхней ступени уже не конвертируется в новые решённые задачи. Для тех, кто оплачивает вызовы по API, это смещает практический выбор в сторону нижних режимов: на ARC-AGI-1 весь разрыв между Low и Max укладывается в 7,5 процентного пункта, а на ARC-AGI-2 составляет 11,7 пункта. При этом сама по себе разница в один пункт между XHigh и Max на ARC-AGI-1 вряд ли оправдывает переключение режима в типовых задачах.

В ARC-AGI-2 Public Eval из 120 задач максимальный режим не справился с тремя: 800d221b, 88bcf3b4 и 88e364bc. Задачу 88e364bc не решил ни один из пяти уровней. Две другие задачи поддались более слабым режимам: 800d221b решили XHigh и High, 88bcf3b4 только High.

В ARC-AGI-1 Public Eval из 400 задач на максимальном уровне провалены четыре: 0d87d2a6, 50f325b5, 8fbca751 и f3b10344. Первая не решена ни на одном уровне, 50f325b5 прошла только на Medium, 8fbca751 только на High, а f3b10344 решена на High, Medium и Low, но не на XHigh и Max.

В таблице лидеров ARC-AGI-2 Claude Fable 5.1 стоит рядом с Claude Fable 5 и Claude Opus 5, а также с GPT-5.6 Sol, GPT-5.6 Luna, GPT-5.6 Terra, Grok 4.6, Gemini 3.7 Flash, DeepSeek V4 Pro 0813, Kimi K3 и Inkling. У остальных моделей в списке указано по две или три версии прогонов.

Пустая колонка ARC-AGI-3

Ни один из пяти режимов Claude Fable 5.1 не получил оценки на ARC-AGI-3: в таблице проверенных результатов там стоит прочерк. Цена за задачу опубликована только для максимального уровня и только по двум наборам Semi-Private, стоимость прогонов на Low, Medium, High и XHigh в отчёте не приводится. Сроки прогона на ARC-AGI-3 не указаны.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.

Два верхних режима Claude Fable 5.1 дают 90% на ARC-AGI-2 · News