Входные токены в тесте Context7 упали примерно на 99%

Upstash опубликовала бенчмарк, в котором её инструмент Context7 сравнивается со встроенными WebSearch и WebFetch в Claude Code: средняя стоимость запроса оказалась ниже на 34,56%, общий расход токенов на 36,81%. Тест вендорский, цифры стоимости взяты из консоли Claude, качество ответов в нём не измерялось.
Коротко
- Прогон шёл через Claude Code Agent SDK на дефолтах Anthropic: основным агентом выступал Claude Opus 4.7, вспомогательные вызовы обрабатывал Claude Haiku 4.5, каждая из пяти категорий запросов содержала по двадцать вопросов.
- Свежих входных токенов Context7 потребовал во всех категориях примерно на 99% меньше: в среднем 386,70 против 38 402,84 у веб-поиска, при этом выходных токенов стало меньше на 52,97%.
- Разрыв между экономией токенов и экономией денег объясняется кэшированием промптов и переносом вспомогательных вызовов на Haiku, поэтому падение входных токенов на 99% не даёт пропорционального выигрыша в стоимости.
Замер сделан вендором и на его собственном наборе запросов, поэтому абсолютные цифры стоит читать как порядок величины, а не как независимую проверку. Тем не менее структура расхода выглядит показательной: агент, который затягивает в контекст целые веб-страницы, платит за это не только деньгами, но и временем ответа. Для команд, где агенты постоянно обращаются к документации, разница в треть счёта складывается в заметную сумму.
Веб-поиск потратил в среднем 38 402,84 свежих входных токена против 386,70 у Context7
Входными в отчёте считаются токены, которые модель обрабатывает заново и которых нет в кэше: сам запрос, результаты вызовов инструментов и определения этих инструментов. По этой статье расходов Context7 в среднем показал 386,70 токена против 38 402,84 у связки WebSearch и WebFetch, то есть сокращение на 98,98%.
Общий объём токенов различался слабее: 84 278,20 у Context7 против 136 562,10 у веб-поиска, поскольку основная масса контекста в обоих случаях приходится на запись и чтение кэша, где средние значения составили 10 911,54 и 71 436,08 против 10 685,96 и 84 183,37. Средняя стоимость запроса вышла $0,14 против $0,22.
Выходные токены, включая финальный ответ, рассуждение и сами вызовы инструментов, сократились в среднем с 3289,93 до 1543,88, а среднее число вызовов инструментов упало с 3,47 до 2,55. В Upstash связывают это с тем, что модели приходится отфильтровывать меньше нерелевантного текста.
На нишевых библиотеках Context7 сэкономил 43,12% стоимости, на популярных 27,89%
Категорий было пять: быстро меняющиеся библиотеки, нишевые продукты, запросы, затрагивающие сразу несколько библиотек, популярные библиотеки и запросы без явно названной библиотеки. В каждой по двадцать вопросов, часть нишевых построена на продуктах недавних компаний Y Combinator, у которых веб-присутствие заведомо невелико.
Лучший результат Context7 показал на нишевых запросах: 43,12% по стоимости и 50,19% по общему числу токенов, а среднее число вызовов инструментов там снизилось с 5,10 до 2,25. Следом идут запросы без указанной библиотеки с экономией 36,94% и запросы к нескольким библиотекам с 35,60%.
Слабее всего преимущество на популярных библиотеках: 27,89% по стоимости и 21,70% по токенам, число вызовов инструментов там сократилось лишь на 6,12%. Как отмечают в Upstash, такие библиотеки веб-поиску найти проще. В категории быстро меняющихся библиотек экономия составила 29,24% при снижении общего числа токенов на 27,12%.
Между прогонами Context7 и веб-поиска выдерживалась пауза в пять минут
Прогоны шли на одном и том же наборе вопросов: к каждому запросу дописывалась инструкция использовать веб-поиск и веб-загрузку либо использовать Context7. Вопросы внутри категории выполнялись подряд, а между прогоном Context7 и прогоном веб-поиска добавлялась пятиминутная пауза, чтобы снизить влияние кэширования промптов.
Стоимость бралась напрямую из консоли Claude в том виде, в каком она отображалась на момент каждого прогона. Полный список вопросов и результаты по каждому из них Upstash выложила в репозиторий бенчмарка. Context7 подставляет в контекст агента срез документации с учётом версии, тогда как веб-поиск отдаёт содержимое страниц целиком.
Бенчмарк на точность и инъекции
Отдельный замер качества ответов и устойчивости к вредоносному и инъектированному контенту в Upstash называют готовящимся, сроков публикации не приводится. Текущий прогон не оценивал ни точность ответов, ни число галлюцинаций, так что заявления о фильтрации небезопасного контента и о доверительной оценке источников цифрами пока не подкреплены. Сравнения с агентами других вендоров, кроме Claude Code, в отчёте нет.
Читайте также
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
