Перейти к содержанию

anthropic

Sonnet 5.5 выдал 410 млн токенов ради третьего места

Claude News

По подсчётам Artificial Analysis, Claude Sonnet 5.5 в режиме максимальных усилий выдал на прогоне сводного индекса 410 миллионов выходных токенов. Это почти в 4,7 раза больше медианы своего класса, которая составляет 88 миллионов. Зато модель набрала 56 баллов при медиане 26 и заняла третье место из 216.

Коротко

  • Anthropic выпустила Sonnet 5.5 28 сентября 2026 года, и Artificial Analysis прогнала через свой индекс рассуждающую версию в конфигурации Adaptive Reasoning, Max Effort, Default Fallback.
  • Прайс ровно по медиане класса: 2 доллара за миллион входных токенов и 10 за выходные, скидка на кэш 90%, а одна задача индекса в среднем обошлась в 7,60 доллара.
  • Скорость вывода Artificial Analysis не замерила, число параметров Anthropic не раскрывает, а все размышления модели оплачиваются по тарифу выходных токенов, поэтому многословность прямо сказывается на счёте.

Если вы не следили: с 9 июня 2026 года у Anthropic над Opus есть ещё один ярус, Mythos-класс, который открыли Claude Fable 5 и Mythos 5. 1 сентября вышли Fable 5.1 и Mythos 5.1 с ограниченным доступом. По данным ScriptByAI, предыдущий Sonnet 5 вышел 30 июня 2026 года как модель для агентного программирования и недорогих агентных сценариев, а Claude Opus 5.5 появился 22 сентября, за шесть дней до Sonnet 5.5.

Sonnet 5.5 набрал 56 баллов в индексе из десяти тестов при медиане класса 26

Artificial Analysis Intelligence Index версии 4.3.2 собран из десяти оценок: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. В наборе есть агентная офисная работа, SaaS-сценарии, программирование в терминале, научный код, физика, проверка знаний и рассуждения на длинном контексте.

Модели сравнивают внутри ценового класса. Закрытые модели Artificial Analysis ставит рядом с моделями той же ценовой категории и считает смешанную цену в пропорции 3:1 для входа и выхода. При тарифе 2 и 10 долларов Sonnet 5.5 попадает в верхнюю группу, где смешанная цена выше 1 доллара за миллион токенов. В этом классе 216 моделей.

Модель закрытая, её веса не опубликованы. Она принимает текст и изображения, отвечает текстом и держит контекст в 1 миллион токенов. По пересчёту Artificial Analysis, это примерно 1 500 страниц A4, набранных 12-м кеглем Arial. Через API модель предлагают три провайдера.

Прогон индекса обошёлся Sonnet 5.5 в 7,60 доллара за задачу при медианном прайсе

Многословность Artificial Analysis оценивает по числу выходных токенов, потраченных на весь индекс. У Sonnet 5.5 в режиме Max Effort их вышло 410 миллионов, у медианной модели класса 88 миллионов. В сводке сервиса модель прямо названа очень многословной.

Тарифы при этом ровно медианные: по API Anthropic 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Скидка на кэшированный ввод составляет 90%. Если смешать цены в пропорции 7:2:1 (попадания в кэш, обычный ввод, вывод), получается 1,54 доллара за миллион токенов.

Задача индекса при этом в среднем стоила 7,60 доллара. Эту сумму сервис считает по ценам на ввод, попадания в кэш, запись в кэш, рассуждения и ответ, взвешивая тесты по их весу в индексе. Для ориентира: по данным ScriptByAI, Claude Opus 5.5 стоит 4 доллара за миллион входных токенов и 20 за миллион выходных, то есть по тарифу вдвое дороже Sonnet 5.5.

Размышления Sonnet 5.5 оплачиваются как обычный вывод

В этом режиме Sonnet 5.5 работает как рассуждающая модель: прежде чем ответить, он выстраивает цепочку рассуждений. Как пишет AI Arte, Claude сначала пересказывает себе вопрос, пробует несколько подходов, проверяет промежуточные результаты и бросает ветки, которые не выдерживают проверки. По тем же данным, токены рассуждений оплачиваются как выходные и засчитываются в max_tokens, даже если текст размышлений вам не возвращают.

Представьте такси, где счётчик крутится на всём маршруте, включая объезды, а водитель в конце называет вам только адрес. По данным блога hidekazu-konishi.com, расширенное мышление впервые появилось в Claude 3.7 Sonnet в феврале 2025 года. С мая 2025 года поколение 4.x добавило параметр effort, которым разработчик выбирает между скоростью и глубиной.

Как пишет AI Arte, потом Anthropic перешла от extended thinking с фиксированным бюджетом budget_tokens к adaptive thinking, где модель сама решает, думать ли и насколько глубоко. В документации Claude Platform Docs сказано, что в ручном режиме минимальный бюджет составляет 1 024 токена и служит ориентиром, а не жёстким потолком.

У страницы Artificial Analysis есть пробелы. Скорость вывода не замерена, число параметров Anthropic не раскрывает, а баллы по отдельным тестам в тексте не приведены, так что по одному числу 56 не понять, в чём именно Sonnet 5.5 силён. На наш взгляд, медианный прайс в 2 и 10 долларов здесь мало что говорит: разница между ним и 7,60 доллара за задачу, вероятно, набегает на рассуждениях, которых в режиме Max Effort почти в 4,7 раза больше медианы.

Когда появится замер скорости

Скорость вывода в токенах в секунду для Sonnet 5.5 Artificial Analysis пока не показывает, хотя модель уже доступна у трёх API-провайдеров. Когда замер появится, станет ясно, сколько времени уходит на задачу при таком объёме рассуждений. Итоговый балл ещё может сдвинуться: тест CritPt в индексе помечен как находящийся на проверке. Сроки обновления сервис не называет.

Читайте также

  1. Opus 5.5 возглавил индекс, наговорив 260 млн токенов
  2. Два верхних режима Claude Fable 5.1 дают 90% на ARC-AGI-2
  3. Opus 5 обгоняет Fable 5 на OSWorld 2.0 за треть цены
  4. Claude Fable 5: возможности и ограничения доступа
  5. Шкала усилий в Opus 4.8 изменилась
  6. Claude Sonnet 5.5 может выйти уже на следующей неделе

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.