benchmarks
Обвязка агента меняет расход токенов
Promtime
benchmarksНезависимый июньский бенчмарк при одинаковых модели и API зафиксировал расход от примерно 3 500 до 292 000 токенов на решённую Python-задачу. Как пишет Thenewstack, 12 конфигураций запускали через OpenRouter сначала с DeepSeek V4 Flash, затем с Nemotron 3 Ultra; порядок результатов между моделями почти не изменился.
Коротко- Разницу создавал начальный контекст: системная инструкция, описания инструментов и настройка среды повторно попадали в запрос на каждом ходе, поэтому исходный размер промпта накапливался быстрее последующих добавлений.
- Composio сообщил, что из 240 запусков 129 завершились успехом в 30 корпоративных сценариях, а стоимость подтверждённого результата варьировалась от $0,028 у Pi Agent до $0,195 у Claude Code.
- Artificial Analysis объединяет 326 задач DeepSWE, Terminal-Bench v2.1 и SWE-Atlas-QnA, усредняя успешность трёх попыток и публикуя стоимость, токены и время для каждой пары модели с обвязкой.
Для платформенных команд эти данные, вероятно, переносят обсуждение расходов с контракта на модель в слой исполнения. Сопоставлять сырой объём токенов отдельно от доли кэша и проверенной успешности недостаточно: более дешёвый запрос не обязательно даёт более дешёвый выполненный сценарий. Судя по методикам тестов, на счёт одновременно влияют минимальный размер промпта, число ходов и маршрут к провайдеру.
Стартовый контекст OpenClaw достигал 26 000 токенов
В июньской серии автор запускал Aider, отдельно учитывая режим architect, Claude Code, Codex, Goose, Hermes, Kilo, Kimi Code, Nanobot, OpenClaw, Opencode и Qwen Code. Все 12 конфигураций работали через OpenRouter на одинаковом API и по очереди с DeepSeek V4 Flash и Nemotron 3 Ultra. Для второй модели OpenRouter предоставлял бесплатный уровень.
Автор оценил начальный объём Aider architect примерно в 700 токенов, а OpenClaw примерно в 26 000. При 15 ходах обвязка с таким минимумом тратила бы около 390 000 входных токенов только на служебный контекст. Зависимость стартового налога от токенов на решённую задачу дала коэффициент детерминации 0,99 на обеих моделях, но каждая комбинация запускалась лишь один раз.
Проверка Composio ограничивала каждую задачу 900 секундами
В августовской работе Composio восемь обвязок тестировались с DeepSeek V4 Flash на 30 сценариях в Airtable, Gmail, Google Calendar, Google Sheets, GitHub, Slack и PostHog. Лимит составлял 900 секунд на задачу. Программный верификатор работал на изолированных наборах данных с ложными и почти совпадающими ключами, а не полагался на оценку LLM.
Composio сообщил, что DeepAgents показал ту же успешность, что и Claude Code, при стоимости одного успеха примерно вчетверо ниже. Успешность восьми обвязок лежала между 46,7% у OpenCode и 66,7% у Pi Agent. Авторы также указали, что Pi Agent использовал разные настройки рассуждений у двух провайдеров, а Prime Agent дал лишь 24 оцениваемых запуска из 30.
Доля кэша у Codex составила около 70%
По данным Composio, Claude Code получил из кэша 1,5% входных токенов, тогда как у Codex эта доля составляла около 70%, а у OMP 57%. Свежие входные токены стоили приблизительно в пять раз дороже кэшированных. Автор июньского теста связал почти нулевую долю кэша Claude Code с маршрутом через Anthropic-совместимый endpoint OpenRouter, а не с текстом промпта.
В июньской серии Codex выставил более миллиона токенов за весь набор задач, при этом 77% приходились на чтения кэша, оплачиваемые примерно по десятой части обычной ставки. Artificial Analysis отдельно учитывает кэшированные входные токены и записи в кэш в модели стоимости. Сервис также сравнивает Claude Code, Cursor CLI и Opencode, удерживая Claude Opus 4.7 неизменным.
Контекст под нагрузкой В июньском тесте перед задачами добавляли 100 000 токенов нерелевантных логов. Семь из 12 конфигураций передали их без потерь, Kilo и Opencode отбросили 83–89%, OpenClaw отказался запускаться, а Kimi Code завершался сбоем. В исходном материале отмечается, что Anthropic, OpenAI, Google и Microsoft по-разному тарифицируют слой обвязки, а DeepSeek сделал компоненты собственного рантайма заменяемыми по лицензии MIT.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
