Перейти к содержанию

anthropic

Ответ Opus 5.5 стоил в 3,4 раза больше, чем у GPT-6 Sol

Claude News

В контрольном прогоне из разбора Aipricing Claude Opus 5.5 и GPT-6 Sol решили все 49 задач без единой ошибки. Opus 5.5 потратил на это 0,05422 доллара, Sol 0,015922, так что в пересчёте на верный ответ Opus обошёлся в 3,4 раза дороже.

Авторы разбора предлагают сравнивать модели по цене принятой задачи, а не по цене токена. На длинных агентных задачах, считают они, расклад может перевернуться.

Коротко

  • 22 сентября 2026 года вышли Claude Opus 5.5 и GPT-6 Sol. По прайсу Sol вдвое дешевле за вход, запись в кэш и выход, а чтение из кэша у обеих моделей стоит одинаково.
  • Если сравнивать с Opus 5, новая модель выглядит заметно лучше: 49 из 49 за 0,05422 доллара против 48 из 49 за 0,09366, и верный ответ подешевел на 43%.
  • Бенчмарки, где Opus 5.5 заметно впереди, публикует сама Anthropic, и настройки усилия там разные. Для задач масштаба целого репозитория короткий контрольный прогон, как признают авторы, ничего не доказывает.

Если вы не следили: по данным VentureBeat, GPT-6 Sol стоит 2 и 10 долларов за миллион входных и выходных токенов. Это ровно вдвое меньше, чем у предшественника GPT-5.6 Sol с его 4 и 20 долларами. Как отмечает то же издание, по цене Sol совпадает с Claude Sonnet 5: в августе Anthropic сделала вводные для Sonnet 5 2 и 10 долларов постоянными.

Opus 5.5 вдвое дороже GPT-6 Sol за вход, запись в кэш и выход

За обычную работу через API в коротком контексте GPT-6 Sol берёт за миллион токенов 2 доллара на входе, 0,20 за кэшированный вход, 2,50 за запись в кэш и 10 на выходе. У Claude Opus 5.5 за миллион токенов 4 доллара на входе, 0,20 за чтение из кэша, 5 за пятиминутную запись в кэш и 20 на выходе. Часовая запись в кэш у Anthropic стоит 8 долларов за миллион.

При равных объёмах токенов Opus вдвое дороже за свежий вход, запись в кэш и выход, а чтение из кэша стоит одинаково. У Sol есть оговорка: запрос длиннее 272 000 входных токенов оплачивается по повышенной ставке. У Opus 5.5 одна стандартная цена на весь контекст в 1 миллион токенов. Как сообщает VentureBeat, в OpenAI заявили, что цены Sol и Luna постоянные и временной акцией не считаются.

На 49 коротких задачах Opus 5.5 не отыграл свою наценку

Контрольный прогон авторы сделали на детерминированном наборе с машинной проверкой, и обе модели набрали 49 из 49 без ошибок. Opus 5.5 потратил 5 330 токенов промпта и 1 645 токенов ответа, Sol хватило 3 426 и 907. К двойной ставке у Opus прибавился больший расход токенов. В итоге 0,05422 доллара против 0,015922, то есть каждый верный ответ в 3,4 раза дороже.

С Opus 5 картина другая. На том же наборе Opus 5 решил 48 из 49 за 0,09366 доллара, так что верный ответ у Opus 5.5 дешевле на 43%. Anthropic раскладывает свою оценку так: стандартные ставки на 20% ниже, чем у Opus 5, чтение из кэша на 60% дешевле, а на типичной нагрузке с настройками по умолчанию экономия около 40%, потому что на задачу уходит меньше токенов.

Измеренные 43% близки к этим 40%, но авторы делают две оговорки. Цифра Anthropic остаётся оценкой вендора и не гарантирует такую же скидку в каждом счёте. А для кодинга масштаба целого репозитория их короткий прогон ничего не доказывает.

По таблице Anthropic Opus 5.5 набирает 66,4% на Terminal-Bench 4.0 против 37,3% у Sol

В таблице, которую Anthropic опубликовала к запуску, у Opus 5.5 66,4% на Terminal-Bench 4.0 и 54,4% на FrontierCode, у GPT-6 Sol там же 37,3% и 47,5%. На CursorBench счёт 57,8% против 41,7%. По мнению авторов разбора, для короткого списка кандидатов эти цифры годятся, но нейтральным сравнением их не назовёшь. Таблицу публикует Anthropic, настройки усилия у результатов разные, а тестовую обвязку и допущения о цене каждый вендор выбирает сам.

Отдельно Anthropic утверждает, что Opus 5.5 на усилии по умолчанию обходит GPT-6 Astra примерно за пятую часть цены. Речь о выбранных сравнениях на FrontierCode и GDPval, и из этого не следует, что каждый запрос выйдет на 80% дешевле. При равных объёмах стандартные ставки на вход и выход у Opus 5.5 на 60% ниже, чем у Astra в коротком контексте. Любая экономия сверх этого должна прийти из хода самой задачи: меньше токенов, вызовов, повторов и провалов.

Через плагин Hermes подписка расходуется примерно в 1,7 раза быстрее, чем в интерактивном Claude Code

В сборке OpenClaw, которую авторы проверили в день запуска, Opus 5.5 в каталоге моделей Anthropic ещё не было. Claude в OpenClaw можно запускать через официальный CLI командой claude -p, и по документации такой путь расходует лимиты Agent SDK той подписки, под которой вы вошли. Модели нет в каталоге, а её запросы изменились несовместимо, поэтому авторы советуют дождаться проверенного пути совместимости или осознанно протестировать собственный обход.

У Hermes есть отдельный экспериментальный плагин Claude Subscription DirectSDK, который пускает ходы Hermes через подписку. В его каталоге от 22 сентября есть claude-opus-5-5[1m], для работы нужны Hermes 0.21.4 или новее и Claude Code CLI с выполненным входом. По собственному тесту плагина, учёт в нём такой же, как у claude -p: примерно в 1,7 раза выше, чем в интерактивном TUI Claude Code. При этом на одинаковых задачах по коду Hermes отправлял около 0,6 от объёма токенов нативного Claude Code.

Эти два эффекта могут компенсировать друг друга, и итоговый счёт покажет только парный тест на одинаковой нагрузке. Плагин не стоит путать с прямым подключением Hermes через OAuth Anthropic: для него описаны другие правила планов и дополнительного использования. Прежде чем считать, что расход входит в подписку, проверьте, какой провайдер выбран.

Счёт за работу агента складывается из шести статей, и ставка за токен лишь одна из них

Авторы предлагают считать эффективную стоимость задачи как сумму шести статей: токены модели, запись в кэш, оплата инструментов, повторы, проваленные прогоны и время ревьюера. При равных объёмах выигрывает Sol, и Opus может оправдать наценку только тем, что работы понадобится меньше. Если Sol нужно десять вызовов, а Opus пять, двукратная разница в прайсе исчезает. При равном числе вызовов Sol обычно остаётся дешевле.

Представьте двух сантехников: тот, у кого ставка вдвое выше, обойдётся дешевле, если починит кран за один визит вместо трёх. Хуже всего дешёвый прогон, после которого патч не проходит тесты. Если инженеру приходится его исправлять, сэкономленные токены уже ничего не значат.

Opus 5.5 всегда работает с адаптивным мышлением и отклоняет запросы, которые пытаются его выключить. Принудительный выбор инструмента не поддерживается, а блоки мышления привязаны к модели и разговору. Одна старая версия инструмента computer use отклоняется в API Anthropic и Google Cloud. Текст о ходе работы, который модель пишет между вызовами инструментов, теперь попадает в блоки мышления.

Если обвязка неправильно обработает любое из этих изменений, агент может уйти в повторы, потерять состояние рассуждений, перестать показывать ход работы или провалить раунд с инструментом. Каждый лишний цикл поднимает эффективную цену задачи.

В разборе нет главного сравнения: длинных агентных задач в реальном репозитории, где у Opus 5.5 могла бы проявиться экономия на числе шагов. Контрольный прогон короткий и проверяется автоматически, а бенчмарки с преимуществом Opus публикует сама Anthropic. На наш взгляд, расклад для Opus 5.5 несимметричный: двойная ставка за токен видна в прайсе сразу, а экономия на шагах пока есть только в оценках вендора.

Как проверить на своём репозитории

Авторы советуют прогнать обе модели на одном наборе задач и одном коммите, с одинаковыми инструментами, правами, состоянием кэша, усилием и правилом остановки. Записывать стоит успешные задачи, токены, вызовы инструментов, время, повторы, провалы и минуты ревью. GPT-6 Luna или Claude Sonnet 5 лучше держать как дешёвый контроль: премиальная модель должна обыграть их по цене принятого результата, одной победы в бенчмарке к запуску мало.

Читайте также

  1. Opus 5.5 возглавил индекс, наговорив 260 млн токенов
  2. Fable 5.1 лидирует в индексе Artificial Analysis, но дороже
  3. Claude Sonnet 5: рост качества при более высокой цене за задачу
  4. Новые модели Claude тратят больше токенов, но дешевле за решённую задачу
  5. Anthropic снова берёт деньги за заблокированные запросы
  6. Opus 5.5 у CodeRabbit поймал 11 новых багов, но упустил 9

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.