Sonnet 5.5 обогнал Opus 5.5 в Terminal-Bench 4.0
В Terminal-Bench 4.0, тесте на работу агента в командной строке, Claude Sonnet 5.5 набрал 70,6%, сообщает Anthropic. У предшественника Sonnet 5 было 10,3%, а старший Opus 5.5 остался позади с 66,4%.
Коротко
- Sonnet 5.5 стал второй моделью семейства Claude 5.5 и уже доступен на всех платформах, включая AWS, Google Cloud и Azure, а Haiku 5.5 обещают в ближайшие недели.
- Цена за токен как у Sonnet 5: 2 доллара за миллион входных и 10 за миллион выходных, но токенов на задачу уходит меньше, а генерация идёт на 30% с лишним быстрее.
- Главная оговорка касается кибербезопасности: по этим навыкам модель сравнялась с Opus 5, поэтому задачи повышенного риска заметно переключаются на Sonnet 5, а на сложной открытой работе Opus 5.5 по-прежнему сильнее.
Если вы не следили: по данным Explainx, Sonnet 5 вышел 30 июня 2026 года, стал моделью по умолчанию в планах Free и Pro и до 31 августа 2026 года продавался по вводной цене 2 доллара за миллион входных токенов и 10 за миллион выходных. Семейство Claude 5.5 открыл Opus 5.5. По словам Anthropic, на большинстве задач он держится на уровне Claude Fable 5.1 и обходится на 40% дешевле Opus 5.
В Terminal-Bench 4.0 Sonnet 5.5 обошёл Opus 5.5, в CursorBench отстал на два пункта
Самый заметный скачок пришёлся на программирование. На среднем усилии, которое стоит по умолчанию в приложениях Claude, Sonnet 5.5 в Terminal-Bench 4.0 далеко обходит лучший результат Sonnet 5 меньше чем за десятую часть стоимости задачи. По данным Tech Blog, Terminal-Bench 4.0 состоит из 66 задач и отбрасывает передовые модели примерно к 60%.
В FrontierCode на высоком усилии Sonnet 5.5 набирает на 10 пунктов больше, чем Sonnet 5 на той же настройке, примерно за пятнадцатую часть стоимости задачи. В CursorBench, собранном из реальных сессий в Cursor, у новой модели 55,5% против 34,1% у Sonnet 5 и 57,8% у Opus 5.5.
Ранние тестировщики отмечали, как быстро модель вникает в кодовую базу. В очных сравнениях она чаще Sonnet 5 собирала вызовы инструментов в пачки, отсюда меньше шагов и ниже счёт. В Epic Games, по словам операционного директора Дэниела Фогеля, Sonnet 5.5 прошёл аудит системного дизайна и ревью потоков данных, удерживал десятки тысяч строк игровой архитектуры и справлялся с многочасовыми задачами при менее подробных промптах.
В GDPval-AA Sonnet 5.5 уступил Opus 5.5 всего два балла
GDPval-AA v2.1 проверяет модели на реальных задачах из 44 профессий и девяти крупных отраслей. Здесь у Sonnet 5.5 1844 балла, у Opus 5.5 1846, у Sonnet 5 1449, у GPT-6 Sol 1487. В AA-Briefcase v1.1 расклад похожий: 1811 у новой модели, 1822 у Opus 5.5 и 1359 у Sonnet 5.
В распознавании графиков Chartography без инструментов Sonnet 5.5 набрал 61,6% против 64,4% у Opus 5.5, 15,6% у Sonnet 5 и 53,6% у GPT-6 Sol. В OSWorld 2.1 (с пометкой partial) у него 80,1%, у Opus 5.5 81,8%, у Sonnet 5 57,0%. Кроме того, Sonnet 5.5 первым из линейки Sonnet прошёл Pokémon Red, глядя только на скриншоты.
Во внутреннем тесте Anthropic дала модели квартальную отчётность публичной компании, стенограммы звонков и шаблон слайдов и попросила операционный обзор на 10 слайдов. Два эксперта признали первый черновик готовым к отправке без правок.
В Slack, по словам главного инженера Кёртиса Аллена, Sonnet 5.5 без правок в промптах обошёл Sonnet 5 почти на всех офлайн-тестах Slackbot, сделав меньше шагов и потратив примерно на 14% меньше выходных токенов.
Цена осталась 2 доллара за миллион входных токенов, а задача дешевеет до 30%
У Sonnet 5.5 те же ставки, что у Sonnet 5: 2 доллара за миллион входных токенов, 10 за миллион выходных и 0,20 доллара за чтение из кэша. Запись в кэш стоит 2,50 доллара. У Opus 5.5 вход, выход и запись в кэш обходятся в 4, 20 и 5 долларов, чтение из кэша в те же 0,20. В ClaudeDevs добавляют, что лимиты Claude Code за счёт экономии растягиваются дальше.
Счёт за задачу складывается из цены токена и их количества, и уровень усилия управляет вторым. На низких настройках Claude отвечает быстрее и тратит меньше токенов, на высоких дольше рассуждает и тщательнее проверяет себя, а стоимость растёт вместе с баллом. Представьте такси с одним тарифом за километр: вы решаете, ехать напрямую или с заездом на проверку.
По тестам Anthropic, на нескольких бенчмарках Sonnet 5.5 на низком или среднем усилии обходит лучший результат Sonnet 5 примерно за десятую часть стоимости задачи. В Claude Code и приложениях по умолчанию стоит среднее усилие, на Claude Platform высокое. На высоких настройках Sonnet 5.5 местами сравним с Opus 5.5 примерно при той же стоимости задачи.
Рискованные запросы по кибербезопасности Sonnet 5.5 передаёт Sonnet 5
Кибернавыки Sonnet 5.5 сопоставимы с Opus 5, поэтому он первым из линейки Sonnet выходит с защитой, похожей на ту, что стоит на Opus 5.5. Искать и чинить баги в своём коде можно как раньше, а задачи повышенного риска заметно переключаются на Sonnet 5. Для специалистов по защите скоро откроют расширенную Cyber Verification Program с многоуровневым доступом к Sonnet 5.5, Opus 5.5 и моделям Claude Mythos.
Биологические фильтры остались как у Sonnet 5. Большинство исследований, учебной и клинической работы они не затрагивают, но Anthropic признаёт, что часть запросов по микробиологии и вирусологии может помечаться по ошибке, и предлагает организациям Life Sciences Verification Program.
Против дистилляции, когда с тысяч фейковых аккаунтов вытягивают возможности модели, Sonnet 5.5 первым из Sonnet получил классификаторы, блокирующие извлечение рассуждений. Мышление привязано к организации, которая его создала: сменили аккаунт посреди сессии в Claude Code, и Claude перечитает сессию и сгенерирует рассуждения заново.
В API модель называется claude-sonnet-5-5 и, как Opus 5.5 и Sonnet 5, доступна с нулевым хранением данных. Если вы запускаете Sonnet с выключенным мышлением, перед переходом придётся включить новую настройку between_tools: она оставляет выключенным мышление перед ответом.
Все цифры в таблицах получены самой Anthropic, и сама же Anthropic признаёт, что бенчмарки показывают лишь одну грань модели, а на сложной открытой работе с долгим суждением Opus 5.5 заметно сильнее. «До 30%» описывает верхнюю границу экономии, средней цифры в анонсе нет. На наш взгляд, рывок с 10,3% до 70,6% в Terminal-Bench 4.0 слишком резкий, чтобы переносить его на свои задачи без проверки: почему Sonnet 5 так провалился именно здесь, Anthropic не объясняет.
Когда ждать Haiku 5.5
Haiku 5.5, рассчитанную на большие объёмы и экономию, обещают в ближайшие недели, точная дата не названа. Сроки открытия расширенной Cyber Verification Program тоже не указаны. У пользователей Pro, Max и Team, по сообщению ClaudeDevs, ещё может лежать сброс лимитов, выданный в прошлый вторник: применить его можно когда угодно до 22 октября.
Читайте также
- Claude Sonnet 5.5 может выйти уже на следующей неделе
- Два верхних режима Claude Fable 5.1 дают 90% на ARC-AGI-2
- Opus 5 обгоняет Fable 5 на OSWorld 2.0 за треть цены
- Claude Fable 5: возможности и ограничения доступа
- Шкала усилий в Opus 4.8 изменилась
- Ответ Opus 5.5 стоил в 3,4 раза больше, чем у GPT-6 Sol
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
