Haiku 5.5 решил 39,2% Terminal-Bench, у Haiku 4.5 был ноль
Haiku 4.5 набрала в Terminal-Bench 4.0 ровно ноль. Claude Haiku 5.5 решает там 39,2%, а миллион входных токенов на коротких промптах стоит у неё десять центов вместо доллара. Цифры взяты из анонса Anthropic: компания оценивает, что в среднем новая модель обходится примерно на 75% дешевле предшественницы.
Коротко
- Anthropic выпустила Haiku 5.5 на всех площадках, включая AWS, Google Cloud и Azure. Заодно вдвое снизилась цена чтения кэша у Sonnet 5.5, а подписчики Max и Team получат ежемесячные кредиты API.
- Цена зависит от длины промпта: до 100 000 токенов вход стоит 0,10 доллара за миллион, выход 0,50, а выше этого порога 0,50 и 2,50 доллара соответственно.
- Сложный агентный код Anthropic по-прежнему советует отдавать Sonnet 5.5 и Opus 5.5. В Terminal-Bench 4.0 у Sonnet 5.5 70,6%, а у Haiku 5.5 только 39,2%.
Если вы не следили: поколение Claude 5 началось с Sonnet 5 30 июня 2026 года, 24 июля вышел Opus 5, а семейство 5.5 открыли Opus 5.5 22 сентября и Sonnet 5.5 28 сентября. Haiku всё это время оставалась в версии 4.5, которая, по данным Anthropic, вышла 15 октября 2025 года. The News Stack называет Haiku 5.5 первым обновлением младшей модели почти за год и третьей моделью 5.5 за месяц.
На промптах до 100 000 токенов вход Haiku 5.5 стоит 0,10 доллара за миллион
На промптах до 100 000 токенов Haiku 5.5 берёт 0,10 доллара за миллион входных токенов и 0,50 за выходные. У Haiku 4.5 было 1 и 5 долларов. Чтение кэша стоит 0,01 доллара против 0,10, запись в кэш 0,125 против 1,25. На промптах свыше 100 000 токенов цены впятеро выше: 0,50 и 2,50 доллара за вход и выход, 0,05 за чтение и 0,625 за запись кэша.
По словам Anthropic, около 90% запросов к прошлой Haiku укладывались в 100 000 токенов. Как уточняет The News Stack, Haiku 4.5 брала одинаково при любой длине запроса, так что за токен скидка составляет 90% на коротких запросах и 50% на длинных. Средние 75% у Anthropic, по объяснению издания, учитывают смесь запросов и обновлённый токенизатор, который тратит на задачу чуть больше токенов.
В офлайн-части OSWorld 2.1 Haiku 5.5 набирает 72,4% против 15,7% у Haiku 4.5
Anthropic сравнивает Haiku 5.5 с Haiku 4.5, GPT-6 Luna и Sonnet 5.5. В офлайн-подмножестве OSWorld 2.1, где агент управляет настоящим компьютером в длинных многошаговых задачах, у новинки 72,4%, у Haiku 4.5 15,7%, у GPT-6 Luna 48,9%, у Sonnet 5.5 83,9%. В GDPval-AA v2.1 счёт 1 620 против 735, 1 437 и 1 840 в том же порядке, в AA-Briefcase v1.1 1 578 против 614, 1 336 и 1 824.
В Humanity's Last Exam Haiku 5.5 решает 45,9% без инструментов и 57,4% с инструментами. У Haiku 4.5 было 10,2% и 18,7%, у Sonnet 5.5 56,9% и 64,5%, для GPT-6 Luna цифр нет. В Chartography без инструментов у Haiku 5.5 46,4% против 6,4%, 29,1% и 61,6%. В FrontierCode 1.1 (Main) у Haiku 5.5 46,4%, у GPT-6 Luna 42,4%, у Sonnet 5.5 на уровне усилия Xhigh 52,1%.
В Terminal-Bench 4.0 Sonnet 5.5 набирает 70,6%, Haiku 5.5 39,2%
Terminal-Bench 4.0 проверяет сложные многошаговые задачи в командной строке. Там у Haiku 5.5 39,2%, у Haiku 4.5 0,0%, у GPT-6 Luna 16,4%. Anthropic сама пишет, что для такой работы Sonnet 5.5 и Opus 5.5 остаются лучшим выбором. Haiku 5.5 рассчитана на узкие задачи вроде сжатия контекста, сводок и работы субагентом, которые раньше было слишком дорого отдавать Claude.
The News Stack добавляет конкурентов, которых нет в таблице Anthropic. По оценке Artificial Analysis, у GLM-5.3-Flash от Z.ai 1 647 баллов в GDPval-AA v2.1 и 1 454 в AA-Briefcase v1.1. Qwen3.7 Flash от Alibaba на международном сервисе стоит 0,03 доллара за миллион входных и 0,13 за миллион выходных токенов на входах до 32 000 токенов. На входах от 32 000 до 256 000 токенов цена 0,10 и 0,40 доллара.
По внутренним оценкам Anthropic, Haiku 5.5 заметно реже ведёт себя некорректно, чем Haiku 4.5. Киберограничения у неё строже, чем у Haiku 4.5, но оборонительных задач разрешают больше, чем у Sonnet 5.5, а пентест блокируется. Биологические фильтры те же, что у Sonnet 5, Sonnet 5.5 и Opus 5. Для более широкой работы есть программы верификации.
Чтение кэша у Sonnet 5.5 подешевело с 0,20 до 0,10 доллара
Одновременно с Haiku 5.5 Anthropic вдвое снизила цену чтения кэша у Sonnet 5.5: с 0,20 до 0,10 доллара за миллион токенов. В компании объясняют, что чтение кэша составляет большую долю потребляемых токенов, поэтому большинство агентных задач на Sonnet 5.5 дешевеют примерно на 20%. На графике для Terminal-Bench 4.0 Anthropic показывает, как сдвигается соотношение точности и стоимости попытки.
На этой неделе подписчики Max и Team получат ежемесячные кредиты API на Claude Platform: 100 долларов на Max 5x, 200 на Max 20x и до 500 на Team, общий пул на всех пользователей. Кредиты подходят для любой модели. В Python- и TypeScript-SDK появилась бета-поддержка computer use и browser use. Haiku 5.5 доступна на Claude Platform как claude-haiku-5-5.
Haiku 5.5 первой из Haiku получила настройку усилия
У Haiku 5.5 появилась настройка усилия, как у остальных моделей Anthropic: вы сами решаете, экономить или выжимать качество. По данным The News Stack, настройка определяет, сколько токенов модель тратит на задачу, а по умолчанию стоит средний уровень. Anthropic показывает точность и стоимость попытки для каждого уровня на графиках, в том числе для OSWorld 2.1.
Вторая часть схемы касается разделения труда. В описании Anthropic более умная модель вроде Fable или Opus планирует работу и раздаёт подзадачи Haiku, так что параллельно можно запускать много агентов. Похоже на прораба с бригадой: дорогой специалист составляет план, а типовую работу делают те, чей час стоит дешевле.
Anthropic называет Haiku 5.5 своей самой быстрой моделью и советует её для живой поддержки клиентов, работы в браузере, сводок, классификации и запросов к базам данных. Aaron Vinh, staff-инженер Asana, рассказал о тестах на AI Teammates, агентном продукте компании. По сравнению с моделью, на которой продукт работает сейчас, задержка выполнения задач упала больше чем на 30%, а вывод на одном шаге агента ускорился до 2,5 раза.
Все цифры из таблицы Anthropic получила сама, методика описана в system card Haiku 5.5. Средние 75% экономии тоже расчётные: на длинных промптах скидка за токен 50%, а новый токенизатор съедает часть выгоды. На наш взгляд, самая практичная строка анонса не Terminal-Bench, а цена чтения кэша в один цент на коротких промптах, ведь субагенты раз за разом перечитывают один и тот же контекст.
Чего ещё нет в линейке 5.5
Из семейства 5.5 пока не вышла Fable 5.5. The News Stack считает, что её проверка, вероятно, займёт заметно больше времени, а дату Anthropic не называет. Ближайшие сроки известны точнее: кредиты API для Max и Team появятся в течение этой недели, а часть действующих клиентов Azure и Google Cloud, по данным The News Stack, получит сниженную цену кэша Sonnet 5.5 через несколько дней.
Читайте также
- Sonnet 5.5 обогнал Opus 5.5 в Terminal-Bench 4.0
- Opus 5.5 на уровне Fable 5.1, но на 40% дешевле Opus 5
- Кеш-чтение подешевело на 75% в Claude Fable 5.1
- Opus 5 вышел по цене Opus 4.8 и стал новым дефолтом на Max
- Anthropic представила модели Claude Fable 5 и Mythos 5
- Anthropic открыла Claude Startups шире: год Team бесплатно
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
