Перейти к содержанию

anthropic

Claude Opus 5.5 считает на 40% дешевле Opus 5

Promtime

Один из ранних тестеров отдал Claude Opus 5.5 миграцию кода на 680 000 строк и получил результат меньше чем за сутки; инженерной команде, по описанию Anthropic, на такую работу понадобились бы недели. Сама Anthropic представляет Opus 5.5 как первую модель семейства Claude 5.5: уровень Claude Fable 5.1 на большинстве задач при расходах на 40% ниже, чем у Opus 5.

Коротко

  • Opus 5.5 стала первым релизом Anthropic после публичного призыва притормозить развитие фронтира, и перед выкатом модель проверяли внешние оценщики, среди них METR и Frontier Design.
  • Миллион токенов стоит 4 доллара на входе и 20 на выходе, на 20% меньше прежнего, чтение из кэша подешевело с 50 до 20 центов, а вывод генерируется более чем на 30% быстрее.
  • Anthropic признаёт и предел проверок: Opus 5.5 часто подозревает, что его тестируют, а при включённых защитах часть кибер- и биозадач уходила к Opus 4.8 и Opus 5.

Если вы не следили за контекстом: неделю назад гендиректор Anthropic Дарио Амодеи выпустил текст «We Must Pace the Frontier» о том, что темп развития ИИ надо соизмерять с тем, успевают ли за ним практики безопасности. Opus 5.5 стал первым релизом после этого призыва. Класс ограничений для него взяли тот же, что у Claude Fable 5.1, на которой Anthropic обкатала защиты по биологии, кибербезопасности и дистилляции.

Аудит кодовой базы на 200 000 строк занял меньше трёх часов

Ранний тестер прогнал через Opus 5.5 аудит и правку кодовой базы на 200 000 строк и получил результат меньше чем за три часа. У Opus 5 на ту же работу ушло больше 20 часов и в 2,5 раза больше токенов.

Во внутреннем тесте Anthropic просила Opus 5.5 и Fable 5.1 переписать HAProxy, балансировщик веб-трафика, с C на Rust. Обе версии прошли почти все собственные регрессионные тесты HAProxy, но Opus 5.5 справился за 9,5 часа против 12 у Fable 5.1 и обошёлся на 51% дешевле.

Ещё одно задание: ускорить загрузку всех страниц веб-приложения. Opus 5.5 справился в 39 случаях из 40, а Opus 5 давал меньший выигрыш и попутно менял поведение приложения. Директор по продукту GitHub Марио Родригес говорит, что в VS Code модель решила больше терминальных задач, чем Opus 5, потратив менее половины шагов.

На Terminal-Bench 4.0 у Opus 5.5 66,4% против 57,9% у GPT-6 Astra

Terminal-Bench 4.0 проверяет, как модель выполняет многошаговые профессиональные задачи в командной строке. Opus 5.5 на усилии xhigh набирает 66,4% при стандартной ошибке ±2,6 пункта, Fable 5.1 набирает 55,8%, Opus 5 52,3%, а GPT-6 Astra на высоком усилии 57,9% по данным OpenAI.

На GDPval-AA v2.1, тесте реальной работы по 44 профессиям, Opus 5.5 на максимальном усилии набирает 1846 Elo против 1735 у Fable 5.1 и 1708 у Opus 5. На AutomationBench, который прогонял Zapier, у модели 40,0% против 41,4% у Astra: прогоны шли без запасных моделей, поэтому срабатывания защит засчитывались как провалы. На Terminal-Bench-Science 0.1 Astra тоже впереди, 64,6% против 58,7%.

Anthropic предупреждает, что на таких уровнях разрывы в бенчмарках плохо предсказывают разницу в реальной работе и что в её собственном использовании зазор между Opus 5.5 и Fable 5.1 уже, чем показывают цифры. Testing Catalog называет релиз новой SOTA в агентном кодинге и работе с компьютером.

16 отчётов из 18 прошли проверку фактов, у Opus 5 и Fable 5.1 ни одного

Внутренний тест выглядел так: написать отчёт о квартальных результатах компании по копии веба, где сам релиз с отчётностью спрятан. Автоматический проверяющий сверял каждую цифру и цитату с источником, любая выдуманная цифра означала провал. У Opus 5.5 планку прошли 16 отчётов из 18 на разных уровнях усилия, у Fable 5.1 и Opus 5 ни одного.

Инвестиционная компания Walleye Capital сообщает, что Opus 5.5 закрыла почти весь их набор проверок на минимальном уровне усилия, а на высоких заметила ошибку в инструкциях к самим проверкам, чего до неё не делала ни одна модель.

В Deloitte Consulting говорят, что на минимальном усилии модель находила 72% известных багов в код-ревью против 56% у Opus 5 на высоком, с меньшим числом ложных срабатываний. Отдельно Anthropic правила манеру письма: Opus 5.5 выносит главное вперёд, реже берёт жаргон и следует заданным правилам. В Ramp говорят, что дизайн-спецификация вышла пригодной почти без правок.

Почему счёт падает на 40%, а цена за токен только на 20%

Экономия складывается из двух частей. Цена за миллион токенов упала с 5 до 4 долларов на входе и с 25 до 20 на выходе, записи в кэш подешевели с 6,25 до 5 долларов. Вторая часть: на ту же задачу Opus 5.5 тратит меньше токенов.

Главная статья расходов в агентных сценариях приходится на чтение из кэша: агент на каждом шаге заново подаёт модели один и тот же контекст, а провайдер держит подготовленную копию и берёт за обращение к ней по сниженной ставке. Здесь цена упала с 50 до 20 центов за миллион токенов, на 60%. Как в счёте из мастерской, где подешевел и час работы, и самих часов стало меньше.

В Claude Code и Claude Platform есть отдельный fast mode, до 2,5 раза быстрее, по 8 долларов за миллион входных и 40 за миллион выходных токенов. Пятичасовые лимиты на планах Pro, Max и Team подняли, а сброс лимита подписчик может отложить и использовать когда удобно.

Модель доступна на всех платформах, включая AWS, Google Cloud и Microsoft Azure, а в Claude Platform обращение идёт по идентификатору claude-opus-5-5.

Попыток выйти за границы изоляции стало на 85% меньше, чем у Opus 5

Основная проверка Anthropic на выравнивание, автоматический поведенческий аудит, прогоняет модель почти по 2000 сценариев. Opus 5.5 показала лучший результат среди протестированных моделей почти по всем измерениям нежелательного поведения. В новой проверке на попытки пересечь границу изоляции таких попыток стало примерно на 85% меньше, чем у Opus 5 или Claude Mythos 5.1, и каждая была низкой серьёзности, о каждой модель сообщила сама.

На бенчмарке компании Gray Swan по промпт-инъекциям Opus 5.5 делит с Fable 5.1 самый низкий показатель успешных атак среди протестированных моделей. Вокруг модели работают классификатор, проверяющий каждое действие до запуска, открытая песочница, которую могут аудировать службы безопасности, и ревью кода до мержа.

Большинство задач по кибербезопасности при этом перенаправляется на Opus 4.8, а по биологии действуют ограничения уровня Fable 5.1, и организациям предложено подать заявку в Life Sciences Verification Program. API-аккаунты, созданные с 31 августа 2026 года, работают с preserved thinking, защитой от дистилляции, которая не даёт редактировать прежний контекст Claude ради извлечения его рассуждений.

Anthropic очерчивает и предел: ловить все сбои до выката пока не умеет никто, а Opus 5.5 часто подозревает, что находится в тесте, и это мешает судить о поведении в реальных условиях. Сюда же сноска про защиты: на кибербенчмарках за модель отвечал Opus 4.8, а на биологии и разработке фронтирных моделей Opus 5, так что таблица описывает связку, а не одну модель. На наш взгляд, ценно, что эта оговорка стоит прямо под цифрами.

Когда появятся Sonnet и Haiku 5.5 Anthropic обещает Claude Sonnet 5.5 и Claude Haiku 5.5 в ближайшие недели, с теми же улучшениями по производительности, эффективности и безопасности, точных дат не называет. В те же сроки должна расшириться Cyber Verification Program: в ней заявлены три уровня доступа, вплоть до моделей Claude Mythos, и проверенные специалисты по кибербезопасности смогут использовать Opus 5.5 в работе. А дальше, как пишет Anthropic, привычка модели подозревать тест будет мешать всё сильнее, если не появится прогресса в интерпретируемости.

Читайте также

  1. Claude Code раздаёт сброс лимитов, который можно отложить
  2. Opus 5.5 подешевел, но ломает агентов в четырёх местах
  3. Opus 5.5 в ревью кода CodeRabbit ловит другие баги
  4. Чтение кэша у Fable 5.1 подешевело на 75%
  5. Anthropic выпустила Claude Sonnet 5
  6. Anthropic снова берёт деньги за отклонённые запросы

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.