Sonnet 5.5 выдал 410 млн токенов ради третьего места

По подсчётам Artificial Analysis, Claude Sonnet 5.5 в режиме максимальных усилий выдал на прогоне сводного индекса 410 миллионов выходных токенов. Это почти в 4,7 раза больше медианы своего класса, которая составляет 88 миллионов. Зато модель набрала 56 баллов при медиане 26 и заняла третье место из 216.
Коротко
- Anthropic выпустила Sonnet 5.5 28 сентября 2026 года, и Artificial Analysis прогнала через свой индекс рассуждающую версию в конфигурации Adaptive Reasoning, Max Effort, Default Fallback.
- Прайс ровно по медиане класса: 2 доллара за миллион входных токенов и 10 за выходные, скидка на кэш 90%, а одна задача индекса в среднем обошлась в 7,60 доллара.
- Скорость вывода Artificial Analysis не замерила, число параметров Anthropic не раскрывает, а все размышления модели оплачиваются по тарифу выходных токенов, поэтому многословность прямо сказывается на счёте.
Если вы не следили: с 9 июня 2026 года у Anthropic над Opus есть ещё один ярус, Mythos-класс, который открыли Claude Fable 5 и Mythos 5. 1 сентября вышли Fable 5.1 и Mythos 5.1 с ограниченным доступом. По данным ScriptByAI, предыдущий Sonnet 5 вышел 30 июня 2026 года как модель для агентного программирования и недорогих агентных сценариев, а Claude Opus 5.5 появился 22 сентября, за шесть дней до Sonnet 5.5.
Sonnet 5.5 набрал 56 баллов в индексе из десяти тестов при медиане класса 26
Artificial Analysis Intelligence Index версии 4.3.2 собран из десяти оценок: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. В наборе есть агентная офисная работа, SaaS-сценарии, программирование в терминале, научный код, физика, проверка знаний и рассуждения на длинном контексте.
Модели сравнивают внутри ценового класса. Закрытые модели Artificial Analysis ставит рядом с моделями той же ценовой категории и считает смешанную цену в пропорции 3:1 для входа и выхода. При тарифе 2 и 10 долларов Sonnet 5.5 попадает в верхнюю группу, где смешанная цена выше 1 доллара за миллион токенов. В этом классе 216 моделей.
Модель закрытая, её веса не опубликованы. Она принимает текст и изображения, отвечает текстом и держит контекст в 1 миллион токенов. По пересчёту Artificial Analysis, это примерно 1 500 страниц A4, набранных 12-м кеглем Arial. Через API модель предлагают три провайдера.
Прогон индекса обошёлся Sonnet 5.5 в 7,60 доллара за задачу при медианном прайсе
Многословность Artificial Analysis оценивает по числу выходных токенов, потраченных на весь индекс. У Sonnet 5.5 в режиме Max Effort их вышло 410 миллионов, у медианной модели класса 88 миллионов. В сводке сервиса модель прямо названа очень многословной.
Тарифы при этом ровно медианные: по API Anthropic 2 доллара за миллион входных токенов и 10 долларов за миллион выходных. Скидка на кэшированный ввод составляет 90%. Если смешать цены в пропорции 7:2:1 (попадания в кэш, обычный ввод, вывод), получается 1,54 доллара за миллион токенов.
Задача индекса при этом в среднем стоила 7,60 доллара. Эту сумму сервис считает по ценам на ввод, попадания в кэш, запись в кэш, рассуждения и ответ, взвешивая тесты по их весу в индексе. Для ориентира: по данным ScriptByAI, Claude Opus 5.5 стоит 4 доллара за миллион входных токенов и 20 за миллион выходных, то есть по тарифу вдвое дороже Sonnet 5.5.
Размышления Sonnet 5.5 оплачиваются как обычный вывод
В этом режиме Sonnet 5.5 работает как рассуждающая модель: прежде чем ответить, он выстраивает цепочку рассуждений. Как пишет AI Arte, Claude сначала пересказывает себе вопрос, пробует несколько подходов, проверяет промежуточные результаты и бросает ветки, которые не выдерживают проверки. По тем же данным, токены рассуждений оплачиваются как выходные и засчитываются в max_tokens, даже если текст размышлений вам не возвращают.
Представьте такси, где счётчик крутится на всём маршруте, включая объезды, а водитель в конце называет вам только адрес. По данным блога hidekazu-konishi.com, расширенное мышление впервые появилось в Claude 3.7 Sonnet в феврале 2025 года. С мая 2025 года поколение 4.x добавило параметр effort, которым разработчик выбирает между скоростью и глубиной.
Как пишет AI Arte, потом Anthropic перешла от extended thinking с фиксированным бюджетом budget_tokens к adaptive thinking, где модель сама решает, думать ли и насколько глубоко. В документации Claude Platform Docs сказано, что в ручном режиме минимальный бюджет составляет 1 024 токена и служит ориентиром, а не жёстким потолком.
У страницы Artificial Analysis есть пробелы. Скорость вывода не замерена, число параметров Anthropic не раскрывает, а баллы по отдельным тестам в тексте не приведены, так что по одному числу 56 не понять, в чём именно Sonnet 5.5 силён. На наш взгляд, медианный прайс в 2 и 10 долларов здесь мало что говорит: разница между ним и 7,60 доллара за задачу, вероятно, набегает на рассуждениях, которых в режиме Max Effort почти в 4,7 раза больше медианы.
Когда появится замер скорости
Скорость вывода в токенах в секунду для Sonnet 5.5 Artificial Analysis пока не показывает, хотя модель уже доступна у трёх API-провайдеров. Когда замер появится, станет ясно, сколько времени уходит на задачу при таком объёме рассуждений. Итоговый балл ещё может сдвинуться: тест CritPt в индексе помечен как находящийся на проверке. Сроки обновления сервис не называет.
Читайте также
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
