Бенчмарк Context7: минус около 99% входных токенов

Замена встроенных инструментов WebSearch и WebFetch в Claude Code на инструменты Context7 снизила стоимость обработки запроса в среднем на 34,56% и расход токенов на 36,81%. Такие результаты собственного бенчмарка опубликовал Upstash, прогнав по 20 запросов в каждой из пяти категорий документационных вопросов.
Коротко
- Тест собран из пяти категорий по 20 запросов: быстро меняющиеся библиотеки, нишевые продукты, запросы к нескольким библиотекам сразу, популярные библиотеки и вопросы, где библиотека не названа.
- Средний прогон одного запроса через веб-поиск стоил $0,22 и потреблял около 136,6 тысячи токенов, тогда как через Context7 стоимость составила $0,14 при 84,3 тысячи токенов.
- Экономия в деньгах вышла заметно меньше, чем в токенах, потому что веб-поиск опирается на кеширование промпта и отдаёт вспомогательные вызовы Claude Haiku 4.5 вместо более дорогого Claude Opus 4.7.
Стоимость поиска документации становится заметной статьёй в агентных циклах, где один вопрос разворачивается в несколько вызовов инструментов и десятки тысяч токенов контекста. Бенчмарк поставлен вендором и меряет только расход, а не точность ответов, поэтому его стоит читать как оценку верхней границы экономии. При этом сама механика выглядит правдоподобно: узкий срез документации дешевле страницы целиком, независимо от того, кто её достаёт.
Свежих входных токенов стало меньше на 98,98%
Основная экономия пришлась на свежие входные токены, то есть на текст, который модель читает заново, минуя кеш: запрос, определения инструментов и результаты их вызовов. Веб-поиск в среднем добавлял 38 402,84 таких токена за прогон, Context7 386,70. Разрыв около 99% сохранился во всех пяти категориях.
В Upstash объясняют разницу тем, что WebSearch и WebFetch, вероятно, возвращают крупные фрагменты страниц целиком, тогда как Context7 отдаёт сжатый срез документации. Выходных токенов у Context7 оказалось на 52,97% меньше, 1543,88 против 3289,93, и в компании связывают это с тем, что агенту приходится отфильтровывать меньше лишнего. Среднее число вызовов инструментов снизилось с 3,47 до 2,55.
В деньгах средний прогон через веб-поиск обошёлся в $0,22, через Context7 в $0,14. Стоимость Upstash брал из консоли Claude на момент каждого запуска. Общий расход токенов, включая запись в кеш и чтение из него, составил 136 562,10 у веб-поиска против 84 278,20 у Context7.
На нишевых библиотеках стоимость упала на 43,12%
Лучший результат Context7 показал на запросах к малоизвестным продуктам: стоимость ниже на 43,12%, общий расход токенов на 50,19%, число вызовов инструментов на 55,88%, с 5,10 у веб-поиска до 2,25. Многие запросы этой категории составлены по недавним компаниям Y Combinator. По объяснению Upstash, в такой среде с низким уровнем сигнала веб-поиску труднее найти нужный источник.
Второй по величине выигрыш пришёлся на запросы без указания библиотеки: минус 36,94% по стоимости и 43,52% по общему числу токенов. Пример такого вопроса из набора: как relations(), one() и many() задают связи отдельно от схем таблиц. На запросах, охватывающих несколько библиотек сразу, стоимость снизилась на 35,60%, а токены на 41,51%.
В категории с несколькими библиотеками у Context7 оказалось больше вызовов инструментов, чем в остальных его прогонах, 3,65 в среднем, но это меньше 4,00 у веб-поиска. Каждый вызов возвращал компактный фрагмент документации, поэтому расход токенов остался низким.
Слабее всего разрыв на популярных библиотеках: 27,89% по стоимости
На популярных библиотеках Context7 сэкономил 27,89% стоимости и 21,70% токенов, на быстро меняющихся 29,24% и 27,12%. В Upstash отмечают, что хорошо документированные проекты веб-поиск находит без лишних заходов. Преимущество в категории быстро меняющихся библиотек в компании связывают с тем, что документация в Context7 разложена по версиям и источникам.
Эксперимент прогнали на Claude Code Agent SDK: один и тот же набор вопросов запускался либо с инструментами Context7, либо со встроенными WebSearch и WebFetch, с соответствующей подсказкой в конце запроса. Использовались дефолтные модели Anthropic: Claude Opus 4.7 как основной агент и Claude Haiku 4.5 для вспомогательных задач. Между прогонами делали пятиминутную паузу, чтобы снизить эффект кеширования промпта.
Отдельный замер качества ответов Компания заявляет, что Context7 отсекает вредоносный контент и инъекции в промпт и даёт меньше галлюцинаций, но в этом бенчмарке измерялись только токены и деньги. Бенчмарк по качеству ответов и безопасности готовится, сроки публикации не названы. Полный набор запросов и результаты по каждому вопросу выложены в репозитории проекта.
Читайте также
- Claude дописывает 2026 к запросам про «лучшее»
- Проверка rtk: обещали −60–90% токенов, вышло +7,6% к счёту
- Claude Code 2.1.283 научился держать новые модели за дверью
- Claude Code не читает AGENTS.md, если выключить телеметрию
- Хуки Claude Code блокируют только на коде выхода 2
- Opus 5.5 у CodeRabbit поймал 11 новых багов, но упустил 9
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
