Перейти к содержанию

anthropic

Opus 5.5 на уровне Fable 5.1, но на 40% дешевле Opus 5

Claude News

Главная скидка в Claude Opus 5.5 сидит в строке, на которую мало кто смотрит: чтение из кэша стоит 0,20 доллара за миллион токенов против 0,50 у Opus 5, а именно оно, по данным Anthropic, составляет большую часть расходов в агентной работе и коде. Токенов на задачу тоже уходит меньше, и в сумме выходит экономия в 40% на типичных нагрузках при настройках по умолчанию, хотя по большинству задач модель работает на уровне Claude Fable 5.1.

Коротко

  • Opus 5.5 открывает семейство Claude 5.5: модель уже доступна в Claude Code, на Claude Platform под именем claude-opus-5-5, а также в Amazon Web Services, Google Cloud и Microsoft Azure.
  • На Terminal-Bench 4.0, тесте многошаговых задач в командной строке, Opus 5.5 на уровне усилий xhigh набирает 66,4% против 52,3% у Opus 5, а текст выдаёт более чем на 30% быстрее.
  • Защита уровня Fable 5.1 перенаправляет большую часть задач по кибербезопасности на Opus 4.8, а сама Anthropic признаёт, что Opus 5.5 часто подозревает, что её проверяют.

Если вы не следили: Opus 5.5 стала первым релизом Anthropic после призыва сдерживать темп развития передовых моделей. Неделей раньше Дарио Амодеи доказывал, что прогресс ИИ нужно вести так, чтобы практики безопасности опережали возможности моделей. Параллельно копились претензии к Opus 5, и манера письма была среди самых частых. По словам Anthropic, Opus 5.5 ставит главное в начало, реже прибегает к жаргону и соблюдает заданные ей правила письма.

Вход и выход подешевели на 20%, чтение из кэша на 60%

Цены за миллион токенов у Opus 5.5 такие: 4 доллара за вход и 20 за выход против 5 и 25 у Opus 5, запись в кэш стоит 5 долларов вместо 6,25. Anthropic объясняет снижение тем, что Opus 5.5 требует меньше вычислений для обслуживания. Генерирует текст она более чем на 30% быстрее Opus 5.

В Claude Code и на Claude Platform есть и быстрый режим: скорость до 2,5 раза выше, цена 8 долларов за миллион входных токенов и 40 за миллион выходных. Пятичасовые лимиты на планах Pro, Max и Team выросли, в Claude Code, по словам аккаунта ClaudeDevs, на 20%, а Opus 5.5 из-за низкой цены растягивается в них на 25% дальше. Сверху подписчики получают сброс лимита, который можно приберечь на любой момент.

На GDPval-AA v2.1 у Opus 5.5 1846 Elo против 1735 у Fable 5.1

В таблице Anthropic Opus 5.5 лидирует в агентном программировании, работе с компьютером и интеллектуальной офисной работе. На GDPval-AA v2.1, тесте реальной работы по 44 профессиям, она набирает 1846 Elo на максимальном уровне усилий, у Fable 5.1 1735, у Opus 5 1708. На Terminal-Bench 4.0 у неё 66,4% на уровне xhigh против 55,8% у Fable 5.1 и 57,9% у GPT-6 Astra на уровне high, по данным OpenAI.

Лидирует она не везде. На AutomationBench, который прогонял Zapier без запасных моделей, у GPT-6 Astra 41,4% против 40,0% у Opus 5.5, а на Terminal-Bench-Science 0.1 Astra набирает 64,6% против 58,7%. Anthropic сама оговаривается, что на таком уровне разница в бенчмарках хуже предсказывает разницу в реальной работе, а в её собственном использовании разрыв между Opus 5.5 и Fable 5.1 уже, чем показывают цифры.

По стоимости разрыв заметнее. На уровне усилий по умолчанию Opus 5.5 обходит GPT-6 Astra на FrontierCode примерно за 20% стоимости задачи, а на GDPval-AA v2.1 на уровне medium опережает Astra на максимальном уровне примерно за пятую часть цены.

У Opus 5.5 аудит кодовой базы в 200 000 строк занял меньше трёх часов, у Opus 5 больше 20

Ранние тестировщики гоняли Opus 5.5 на длинных задачах. Один перенёс 680 000 строк кода меньше чем за день, хотя команде инженеров на такое понадобились бы недели. Другой провёл аудит и исправление кодовой базы в 200 000 строк менее чем за три часа, тогда как Opus 5 потратила больше 20 часов и в 2,5 раза больше токенов.

Во внутреннем тесте Anthropic Opus 5.5 и Fable 5.1 переписывали балансировщик веб-трафика HAProxy с C на Rust. Обе версии прошли почти все регрессионные тесты самого HAProxy, но Opus 5.5 справилась за 9,5 часа против 12 у Fable 5.1 и обошлась на 51% дешевле.

В другом тесте Opus 5.5, Fable 5.1 и Opus 5 писали отчёт о квартальных результатах компании по копии интернета, где пресс-релиз было трудно найти. Автоматический проверяющий сверял каждую цифру и цитату с источниками, и любая выдумка валила отчёт. Планку прошли 16 из 18 отчётов Opus 5.5 при разных уровнях усилий, у Fable 5.1 и Opus 5 не прошёл ни один.

Границы изоляции Opus 5.5 пыталась обойти примерно на 85% реже, чем Opus 5

До релиза Opus 5.5 проверяли внешние оценщики, в том числе METR и Frontier Design. В автоматическом поведенческом аудите почти на 2 000 сценариев она показала лучший результат среди недавних моделей Claude почти по каждой мере несогласованного поведения. В новом тесте она пыталась обойти границы изоляции примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1, и каждая попытка была низкой тяжести, о ней модель сообщала сама.

К промпт-инъекциям, то есть командам, подброшенным модели через чужой текст, Opus 5.5 устойчивее: во всех проверенных сценариях, от кода до веб-браузинга, она не хуже Opus 5. На бенчмарке компании Gray Swan она делит с Fable 5.1 самый низкий процент успешных атак среди протестированных моделей.

Большую часть задач по кибербезопасности за Opus 5.5 выполнит Opus 4.8

Opus 5.5 стала первой Opus с защитами класса Fable 5.1 в трёх областях: кибербезопасность, биология и дистилляция. Работает это как подмена исполнителя: помеченный запрос обрабатывает другая модель. Похоже на регистратуру, которая с определённой жалобой отправляет вас не к терапевту, а к другому врачу.

Искать и чинить баги в собственном коде в обычном цикле разработки можно, но большую часть задач по кибербезопасности защита перенаправит на Opus 4.8. Для биологии действуют те же защиты, что у Fable 5.1, а проверенные организации, от академических лабораторий до фармкомпаний, уже могут подать заявку в новую Life Sciences Verification Program.

Против дистилляции, когда через тысячи фальшивых аккаунтов из модели выкачивают её способности, работает preserved thinking: API-пользователи не могут править прежний контекст Claude, чтобы вытащить рассуждения. Правило касается API-аккаунтов, созданных 31 августа 2026 года или позже. Режима с выключенным thinking у Opus 5.5 нет.

Главную оговорку Anthropic делает сама: Opus 5.5 часто подозревает, что её проверяют, поэтому лучший результат аудита ещё не гарантирует такого же поведения в реальной работе. Бенчмарки шли с включёнными защитами, и где они срабатывали, работу доделывали Opus 4.8 или Opus 5, так что чистых цифр Opus 5.5 по кибербезопасности и биологии нет. На наш взгляд, специалистам по безопасности скидка мало что даст, пока Cyber Verification Program не расширят, а ложные срабатывания в ClaudeDevs пока только обещают сократить.

Когда подтянутся Sonnet 5.5 и Haiku 5.5

Sonnet 5.5 и Haiku 5.5 Anthropic обещает в ближайшие недели, со многими из тех же улучшений в производительности, эффективности и безопасности, но точных дат не называет. В те же недели Cyber Verification Program должна открыться для Opus 5.5 с тремя уровнями доступа, включая доступ к моделям Claude Mythos. Если ваш API-аккаунт создан 31 августа или позже, интеграции стоит проверить на совместимость с preserved thinking уже сейчас.

Читайте также

  1. Сброс лимитов Claude можно придержать до 22 октября
  2. Тестеры ловят Claude Fable 5.2 в тихом A/B-тесте
  3. Opus 5.5 подешевел, но ломает агентов ошибкой 400
  4. Anthropic советует удалить из промптов «думай внимательно»
  5. Кеш-чтение подешевело на 75% в Claude Fable 5.1
  6. Opus 5 вышел по цене Opus 4.8 и стал новым дефолтом на Max

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.