claude-code

Тот же результат, вдвое дороже: Claude Code против Codex

Claude News

claude-code

Команда aistack сравнила три обвязки для кодинг-агентов, Claude Code, Codex и Pi, на 64 задачах из SWE-Bench Pro: на модели GLM-5.3-Flash все три решили по 32–33 задачи, но аренда GPU на полный прогон стоила 22,8 доллара через Codex и 45 долларов через Claude Code и Pi. Замеры опубликованы в блоге Imec-int, вторая модель, Qwen3.8-27B, дала похожую картину по точности.

Коротко

  • На GLM-5.3-Flash Codex прошёл прогон за 1,26 часа и 2,1 млн выходных токенов, тогда как Claude Code и Pi потратили по 2,48 часа при 3,97 и 3,79 млн токенов соответственно.
  • Аренда GPU на полный прогон GLM-5.3-Flash на четырёх H200 составила 22,8 доллара у Codex против 45 долларов у Claude Code и Pi, а на одной H200 с Qwen3.8-27B разрыв сжимается до 9 и 10,26 доллара.
  • Обвязки вели себя нестабильно: в Claude Code 2.1.233 сломалось префиксное кеширование, а воркеры Pi регулярно уходили в бесконечный цикл и снимались оркестратором по лимиту в четыре часа.

Для команд, которые держат инференс на своём железе, это смещает критерий выбора. Обвязку обычно берут по удобству и по тому, что уже стоит у разработчиков, а счёт формируется временем удержания GPU, то есть объёмом сгенерированных токенов и длиной контекста. Судя по замерам, при сопоставимой точности разница в этих метриках доводит разброс стоимости прогона до двух раз, и это тот рычаг, который в автоматизированных пайплайнах переключается проще, чем модель.

Все шесть связок обвязки и модели решили от 28 до 33 задач из 64

Тестировали две модели в FP8: Qwen3.8-27B на одной NVIDIA H200 и GLM-5.3-Flash на четырёх. Каждая обвязка работала в настройках по умолчанию и без доработок, конфигурация движка инференса была одинаковой во всех прогонах. Qwen3.8-27B набирает 52 балла в Artificial Analysis Intelligence Index и 51 в Agentic Index того же проекта.

На Qwen3.8-27B Claude Code решил 33 задачи, Codex 31, Pi 28, а на GLM-5.3-Flash Codex вышел на 33 задачи, Claude Code и Pi на 32. Разброс между шестью связками составил пять задач из 64. Авторы делают вывод, что по одной только доле решённых задач выбирать обвязку сейчас смысла нет.

Claude Code прогнал через GLM-5.3-Flash 480,2 млн входных токенов, Codex 192,1 млн

На Qwen3.8-27B Claude Code отправил в модель 445,8 млн входных токенов, Codex 330,5 млн, Pi 348,5 млн; на GLM-5.3-Flash это 480,2 млн у Claude Code, 366,4 млн у Pi и 192,1 млн у Codex. Пиковая занятость KV-кеша на Qwen3.8-27B при восьми параллельных сессиях: 78,8% у Claude Code, 72,1% у Pi, 59,8% у Codex.

Выходных токенов пять из шести связок сгенерировали от 3,33 до 3,97 млн, и только Codex на GLM-5.3-Flash уложился в 2,1 млн. Он же прошёл все 64 задачи за 1,26 часа настенного времени против 2,48 часа у Claude Code и Pi на той же модели, то есть 50,5 задачи в час против 25,8 и 25,9.

Час одной H200 на Modal стоит 4,54 доллара, час четырёх H200 стоит 18,16 доллара. Полный прогон GLM-5.3-Flash обошёлся в 22,8 доллара через Codex и в 45 долларов через Claude Code и Pi, а на Qwen3.8-27B цифры составили 9, 10,26 и 10,16 доллара. По ценам API Anthropic та же нагрузка стоила бы около 98 долларов.

Префикс-кеш в Claude Code 2.1.233 на Qwen3.8-27B просел до 29,84% против 97,36% у исправленной сборки

После обновления, вышедшего уже во время тестов, средняя доля попаданий в префикс-кеш на Qwen3.8-27B упала до 29,84% при p10–p90 в диапазоне 23,4–37,8%. У пропатченной сборки средняя доля составила 97,36%, у Codex на той же модели 96,58%, у Pi 95,50%. Одновременно ухудшились время до первого токена и скорость генерации, ишью заведён в репозитории claude-code.

Вторая аномалия касалась Pi: один-два воркера застревали в бесконечном цикле и в итоге выдавали повторяющийся мусор, пока оркестратор не снимал их по лимиту в четыре часа. Поведение повторялось и на Qwen3.8-27B, и на GLM-5.3-Flash, каждый раз на разных задачах, поэтому все показатели Pi в отчёте посчитаны по чистым прогонам и средним оценкам.

Почему эксперимент прогоняли заново

Авторы сообщают, что при разборе действий агентов они нашли поведение, из-за которого весь эксперимент пришлось запускать заново, и обещают описать находку в отдельном материале. Следующей темой заявлено сравнение движков инференса. Обе аномалии в блоге считают временными, но сроков исправления ни для Pi, ни для Claude Code не названо, а сами цифры авторы называют снимком на текущий момент.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.