Sonnet 5.5 обошёл Opus 5.5 в Terminal-Bench 4.0

В Terminal-Bench 4.0 предыдущий Sonnet набирал 10,3%, а Claude Sonnet 5.5 набирает 70,6% и обходит даже старшую Opus 5.5 с её 66,4%. Цена за токен при этом осталась прежней, а задача, по данным Anthropic, обходится до 30% дешевле.
Коротко
- Anthropic выпустила Sonnet 5.5, вторую модель семейства Claude 5.5 после Opus 5.5; она уже работает на Claude Platform, в AWS, Google Cloud и Azure, а Haiku 5.5 обещают в ближайшие недели.
- Цена за токены не изменилась: 2 доллара за миллион входных и 10 за миллион выходных, но на ту же работу модель тратит меньше токенов и отвечает более чем на 30% быстрее Sonnet 5.
- Sonnet 5.5 первым среди Sonnet получил киберзащиту как у Opus 5.5: рискованные запросы по кибербезопасности заметно переключаются на Sonnet 5, а обычный поиск и исправление багов работают как раньше.
Если вы не следили: семейство Claude 5.5 открыла Opus 5.5, которая, по данным The News Stack, вышла неделей раньше и при этом подешевела, а Sonnet 5.5 появился в понедельник. В линейке Anthropic Opus отвечает за сложную работу, где нужно аккуратное суждение, Sonnet за повседневные задачи с понятными рамками: баги, документы, слайды и таблицы. Haiku 5.5 для больших объёмов и дешёвых запросов ещё впереди.
В Terminal-Bench 4.0 Sonnet 5.5 набрал 70,6% против 10,3% у Sonnet 5
Terminal-Bench 4.0 проверяет, как модель справляется со сложными многошаговыми профессиональными задачами в командной строке. Результата GPT-6 Sol в этом тесте нет: ни сопровождающие Terminal-Bench, ни OpenAI его публично не приводили, поэтому Anthropic ставит в сравнение GPT-5.6 Sol.
В FrontierCode на уровне усилий High новая модель набирает на 10 пунктов больше Sonnet 5 на той же настройке, тратя на задачу примерно пятнадцатую часть денег. Как поясняет The News Stack, этот тест Cognition проверяет, можно ли влить изменение в код без правок человека; на втором по величине уровне усилий Sonnet 5.5 набирает там 52,1% против 54,4% у Opus 5.5 и 49,3% у GPT-6 Sol.
В CursorBench, собранном из задач реальных сессий в Cursor, у Sonnet 5.5 55,5% против 57,8% у Opus 5.5 и 34,1% у Sonnet 5. Тестировщики отмечали, что модель быстро разбирается в кодовой базе и чаще объединяет вызовы инструментов в пакеты. В Epic Games, по словам операционного директора Дэниела Фогеля, она держала архитектуру игровых систем на десятки тысяч строк, выдерживала многочасовые задачи и обходилась менее подробными промптами.
В GDPval-AA Sonnet 5.5 отстаёт от Opus 5.5 на два пункта
GDPval-AA проверяет модели на реальных задачах из 44 профессий и девяти крупных отраслей; как уточняет The News Stack, этот тест Artificial Analysis ранжирует их по рейтингу Эло. У Sonnet 5.5 там 1 844 пункта, у Opus 5.5 1 846, у Sonnet 5 1 449, у GPT-6 Sol 1 487. В AA-Briefcase расклад похожий: 1 811 против 1 822 у Opus 5.5, 1 359 у Sonnet 5 и 1 483 у GPT-6 Sol.
В управлении компьютером (OSWorld 2.1, вариант partial) у Sonnet 5.5 80,1% против 81,8% у Opus 5.5 и 57,0% у Sonnet 5. В распознавании графиков без инструментов (Chartography) 61,6% против 64,4% у Opus 5.5, 15,6% у Sonnet 5 и 53,6% у GPT-6 Sol. В Humanity’s Last Exam с инструментами 64,5% против 67,7% и 54,9%. А ещё Sonnet 5.5 стал первым Sonnet, прошедшим Pokémon Red только по скриншотам.
Тестировщики называли модель более естественным собеседником и хвалили чутьё на дизайн: она доводит интерфейсы и собирает презентации по шаблону почти без правок. Во внутреннем тесте Anthropic дала ей квартальные материалы публичной компании, стенограммы звонков и шаблон и попросила операционный обзор на 10 слайдов. Два эксперта сочли первый черновик готовым к отправке.
Токен стоит столько же, а задача обходится до 30% дешевле
Расценки Sonnet 5 сохранились: 2 доллара за миллион входных токенов, 10 за миллион выходных и 0,20 доллара за миллион при чтении из кэша; запись в кэш стоит 2,50 доллара. У Opus 5.5 вход и выход вдвое дороже, 4 и 20 долларов, запись в кэш 5 долларов, чтение те же 0,20.
По данным The News Stack, в тот же день OpenAI вдвое снизила цены на GPT-6 Sol и Luna, так что у Sonnet 5.5 сейчас те же расценки, что у GPT-6 Sol, второй по силе модели OpenAI после Astra.
Экономия идёт от числа токенов. Представьте копирайтера с оплатой за знаки: ставка та же, но если он пишет короче и не переделывает абзацы, счёт меньше. В Slack, по словам главного инженера Кёртиса Аллена, Sonnet 5.5 без смены промптов обошёл Sonnet 5 почти во всех офлайн-тестах Slackbot, сделав меньше шагов и потратив примерно на 14% меньше выходных токенов. Генерирует он более чем на 30% быстрее, самый быстрый Sonnet на сегодня.
Зачем Sonnet 5.5 несколько уровней усилий?
Уровень усилий (effort) задаёт, сколько модель думает над задачей. На низких настройках Claude отвечает быстрее и тратит меньше токенов, что подходит для рутины, на высоких дольше рассуждает и тщательнее проверяет себя, поэтому задача дороже, а результат обычно лучше. В Claude Code и приложениях по умолчанию стоит Medium, на Claude Platform High.
По данным Anthropic, на нескольких тестах Sonnet 5.5 на Low или Medium обходит лучший результат Sonnet 5 примерно за десятую часть стоимости задачи. В Terminal-Bench 4.0 на Medium он заметно превосходит лучший результат Sonnet 5 меньше чем за десятую часть цены. На уровне Max на ряде оценок модель сопоставима с Opus 5.5, но на высоких настройках и стоит примерно столько же.
Sonnet 5.5 первым среди Sonnet получил киберзащиту как у Opus 5.5
Киберспособности Sonnet 5.5, по оценке Anthropic, сопоставимы с Opus 5, поэтому защита у него похожа на ту, что стоит на Opus 5.5. Задачи с повышенным риском заметно для пользователя уходят на Sonnet 5. Скоро специалисты по киберзащите смогут подать заявку в расширенную Cyber Verification Program и получить ступенчатый доступ к возможностям Sonnet 5.5, Opus 5.5 и моделей Claude Mythos.
Защита в биологии та же, что у Sonnet 5; часть запросов по микробиологии и вирусологии может помечаться по ошибке, для полного доступа есть Life Sciences Verification Program. Против дистилляции, когда через тысячи фейковых аккаунтов из модели вытягивают возможности, Sonnet 5.5 первым среди Sonnet получил классификаторы, мешающие извлекать рассуждения. Его мышление привязано к создавшему его аккаунту, и смена аккаунта посреди сессии в Claude Code описана в документации.
В автоматическом аудите поведения примерно на 1 850 сценариях Sonnet 5.5 по большинству показателей не хуже Sonnet 5, а границы контейнера прощупывает реже всех моделей Anthropic. Opus 5.5 в целом чуть лучше, признаков целей вопреки пользователю не нашли. Как Opus 5.5 и Sonnet 5, модель доступна с нулевым хранением данных.
Все цифры в анонсе приводит сама Anthropic, а скачок в Terminal-Bench, по замечанию сопровождающих теста в пересказе The News Stack, отчасти объясняется тем, что Sonnet 5 упирался в тайм-ауты и лимиты токенов. Anthropic и сама признаёт, что в сложной открытой работе Opus 5.5 заметно сильнее. На наш взгляд, при подешевевшей Opus 5.5 и урезанных ценах OpenAI вся экономия Sonnet 5.5 держится на токенной эффективности, которую мерила сама Anthropic.
Haiku 5.5 и переход на between_tools
Haiku 5.5 Anthropic обещает в ближайшие недели, точной даты нет, как нет её и у расширенной Cyber Verification Program. Если вы запускаете Sonnet с выключенным мышлением, перед переходом на claude-sonnet-5-5 нужно включить новую настройку between_tools, которая оставляет выключенным предварительное размышление. Opus 5.5, по данным The News Stack, запросы с полностью выключенным мышлением уже отклоняет.
Читайте также
- 90% на ARC-AGI-2 стоят 4,49 доллара за задачу
- Opus 5 стоит треть цены Fable 5 на агентных задачах
- Opus 5 обгоняет флагман Anthropic Fable 5 на бенчмарках
- Opus 5.5 в ревью кода CodeRabbit ловит другие баги
- Claude Opus 5.5 считает на 40% дешевле Opus 5
- Дообучение MiMo-V2.6-Pro обошлось Xiaomi в 2,62 миллиона
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
