anthropic

Индекс концептуальных рассуждений: Opus 5 набрал 73,6

Claude News

anthropic

Redwood Research вместе с Anthropic выпустила Conceptual Reasoning Index, сводную оценку концептуальных рассуждений моделей, где на 10 августа 2026 года лидирует Opus 5 с 73,6 балла. Индекс собран из трёх бенчмарков, LMCA, ACCoRD и DTBench capabilities, и описан в материале Anthropic.

Коротко

  • В LMCA собрано 560 текстов с позициями и 1 461 аргумент против них, ACCoRD содержит 567 отобранных ограничений на согласованность, DTBench capabilities состоит из 407 вопросов по теории решений.
  • Концептуальными авторы называют задачи, где эмпирических данных мало, проверяемого ответа нет и приходится опираться главным образом на аргументацию; работа сделана Redwood Research в сотрудничестве с Anthropic и опубликована 12 августа.
  • Результаты моделей растут почти линейно с конца 2024 года без признаков выхода на плато, при этом DTBench capabilities близок к насыщению: Fable 5 отвечает верно на 98% вопросов.

Почему это важно. Большая часть работы по снижению рисков от продвинутого ИИ не имеет быстрой эмпирической проверки, и именно там модели обычно слабее всего. Измеримая шкала для такого класса задач выглядит попыткой сделать этот разрыв видимым и управляемым: если аргументацию можно оценивать, её можно и целенаправленно улучшать. Для практики это означает, что оценки рассуждающих моделей получают шкалу, слабо связанную с привычными кодовыми и математическими бенчмарками.

LMCA даёт 60% веса индекса и опирается на 2 140 экспертных оценок

LMCA (Language Model Conceptual Argumentation) состоит из отобранных аргументов по теории решений, философии и рискам продвинутого ИИ с экспертными оценками. В наборе 560 текстов с позициями и 1 461 аргумент против них, суммарно 2 140 оценок. Почти все аргументы получили оценку от Emery Cooper, остальные 16 из 1 461 оценил Caspar Oesterheld.

Модель оценивают по совпадению её рейтингов с человеческими по детальной рубрике. В валидационную часть вошли около 50 аргументов, каждый независимо оценили 4–6 человек, а затем обсудили в общей сложности 7–8 часов; согласие между людьми оказалось выше, чем между людьми и моделями.

LMCA допускает и измерение способности самих моделей аргументировать: одна модель пишет новый аргумент против позиции, вторая оценивает его по рубрике с few-shot примерами из уже размеченных аргументов. В CRI пока входит только оценка суждений, авторы рассчитывают добавить второй режим в будущих версиях индекса.

В ACCoRD отобрано 567 ограничений из почти 14 000, в DTBench capabilities 407 вопросов

ACCoRD (Assessment of Consistency in Conceptual Reasoning Domains) проверяет, насколько логично согласуются заявленные моделью убеждения и предпочтения. Разным экземплярам одной модели задают, например, вероятность P(A) и вероятность P(A&B), после чего сверяют, выполняется ли P(A) ≥ P(A&B).

Все ограничения требуют либо числовых оценок вероятности, либо упорядочивания предпочтений. Набор содержит около 14 000 сгенерированных моделями ограничений 18 типов, прошедших автоматическую проверку; вручную подтверждены и включены в индекс 567 из них. Низкая согласованность на наборе вопросов, по мнению авторов, означает, что рассуждениям модели там нельзя доверять по умолчанию.

DTBench capabilities состоит из 407 вручную составленных вопросов с выбором ответа о ситуациях, где модель должна учитывать точные предсказания собственного поведения или взаимодействие с почти копиями себя. Большинство вопросов оригинальны и составлены Caspar Oesterheld, все они прошли независимую проверку у Emery Cooper. Ещё 130 вопросов об установках моделей в теории решений в CRI не входят.

Opus 5 набрал 73,6 балла при оценочном потолке индекса около 91

Индекс считается как взвешенное среднее: LMCA 60%, ACCoRD и DTBench capabilities по 20%. Шкала идёт от 0, что соответствует случайному угадыванию, до 100, максимально возможного результата по всем бенчмаркам; из-за шума в человеческих оценках LMCA реалистичный максимум там авторы оценивают примерно в 85 баллов, а по индексу в целом около 91.

Лучший результат на 10 августа 2026 года у Opus 5: 73,6 балла с 95-процентным доверительным интервалом ±2,1. В сравнение включены лучшие модели других компаний, а также Claude Fable 5, Muse Spark 1.2 и Gemini 3.6 Flash, которые лидируют на многих внешних бенчмарках, но не на CRI.

Все модели запускались на максимальных лимитах токенов и уровнях усилий. Для Fable 5 в случаях отказа отвечать использовался запасной вариант в виде Opus 5, а результат GPT-4 по ACCoRD неполон: модель отказалась полностью отвечать на 18% пунктов бенчмарка. На графиках каждая точка соответствует самой способной модели лаборатории на момент её выхода.

Что дальше. Авторы планируют добавлять в индекс новые бенчмарки, выводить из него насыщенные и, возможно, менять веса. По их оценке, LMCA начнёт насыщаться примерно через год, DTBench capabilities уже близок к потолку, а срок насыщения ACCoRD они называют сильно неопределённым. Актуальные результаты публикуются на сайте индекса conceptualreasoning.ai, доступ к LMCA открывается по заявке через форму.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.