anthropic
Аудит промптов в Claude Code срезал 14,6% затрат
Claude News
anthropicAnthropic добавила в навык claude-api команду /claude-api prompt-audit, которая на тесте миграции с Opus 4.8 на Opus 5 снизила стоимость в среднем на 14,6% и подняла точность на 5,3%. Разбор трёх рычагов экономии, от кэша промпта до калибровки усилия, и результаты замеров опубликовал блог Claude.
Коротко
- Команда разбирает промпты, навыки и описания инструментов в рабочей папке и убирает устаревшие подпорки: ритуалы перепроверки, усилители вроде «будь максимально дотошным», ручные блокноты для рассуждений и противоречивые правила.
- Вторая команда, /claude-api cost-optimize, профилирует, куда уходят токены, и на четырёх публичных бенчмарках с базой Sonnet 5 срезала от 52% стоимости на OfficeQA Pro до 73% на tau2-bench retail.
- Третья команда, /claude-api hillclimb, делит оценочный набор на обучающую и тестовую части и на 14 отложенных тикетах бенчмарка поддержки довела итоговую конфигурацию до 90,5% против 78,6% у исходной при примерно впятеро меньшей стоимости.
Экономия обычно обсуждается как размен цены на качество, но замеры показывают другое распределение расходов: заметная часть счёта уходит на работу, которую фронтирные модели делают сами, а старый промпт заставляет повторять. Для команд, годами наращивавших инструкции под прежние поколения моделей, это выглядит как технический долг, накопленный в тексте, а не в коде. Судя по описанию, основной выигрыш даёт уборка после смены модели, а не сама смена.
Снятая настройка размышления заставляла API отклонять каждый запрос маршрутизации
Тест строили от чистого промпта на бенчмарке клиентской поддержки: в него по очереди добавляли по одному анти-паттерну, получив шесть устаревших версий. Каждую прогоняли на Opus 4.8, на Opus 5 с заменой одного идентификатора модели и на Opus 5 после однократного прогона prompt-audit; цифры усреднены по шести промптам.
Рост точности на 5,3% сложился из трёх причин: снятая настройка размышления вынуждала API отклонять все запросы маршрутизации, противоречивые правила о возвратах заставили Opus 5 удержать четыре положенных возврата, а ручной блокнот столкнулся со встроенным мышлением, и на трёх тикетах модель написала вызов инструмента внутри рассуждения и не выполнила его.
Снижение стоимости на 14,6% дали убранные лишние вызовы: «перепроверь дважды» на Opus 5 дублировал поиск заказа при каждом возврате, а «будь максимально дотошным» разворачивался в десятки ненужных поисков по базе знаний. Аудит охватывает и конфигурацию Claude Code, включая CLAUDE.md и навыки.
На CursorBench 3.2 Fable 5.1 при низком усилии повторяет результат Fable 5 при высоком
Усилие задаёт, насколько долго модель обдумывает ответ, и разброс по стоимости бывает большим. На FrontierCode Diamond, наборе из 50 самых сложных задач, Fable 5 при низком усилии набирает 11,5% при 5,35 доллара за задачу, а при максимальном 30,9% при 19,00 доллара: рост результата примерно в 2,7 раза обходится примерно в 3,5 раза дороже.
На Humanity's Last Exam без инструментов Fable 5.1 показывает около 53% при низком усилии и примерно 0,30 доллара за вопрос, около 61% при максимальном и примерно 2,23 доллара. Последний шаг до максимума добавляет около половины пункта при росте стоимости на 46%, что укладывается в разброс между прогонами.
На CursorBench 3.2 Fable 5.1 при низком усилии выходит на уровень Fable 5 при высоком втрое дешевле. Часть разницы даёт цена чтения из кэша промпта: 0,25 доллара за миллион токенов у Fable 5.1 против 1,00 доллара у Fable 5; по ценам Fable 5 экономия составила бы около 40%.
На SWE-bench Verified медиана шагов на задачу упала с 29 до 17
Команда /claude-api hillclimb перебирает конфигурации, опираясь на разбор проваленных обучающих примеров. Стартовав с Opus 4.8 на усилии по умолчанию, она перешла на Opus 5 с низким усилием и прогоном prompt-audit (98,9% на обучающей выборке, 2,6 цента за тикет), затем на Sonnet 5 с низким усилием: 1 цент за тикет при 88,9%, а после добавления правил маршрутизации и сверки лимита возврата снова 98,9%.
Команда /claude-api cost-optimize определяет, куда уходят токены, по отчётам об использовании через Claude Admin API, по объекту usage в ответах API или по коду, который собирает запросы. На LegalBench она предложила кэшировать общий префикс, низкое усилие и Batch API: токены размышления упали со 102 779 до 8284, доля успешных прохождений осталась в пределах шума, стоимость снизилась примерно на 58%.
На tau2-bench retail расстановка явных точек кэширования дала около 73% экономии без изменения доли успешных прохождений, на OfficeQA Pro батчинг и кэширование документов снизили стоимость со 136,20 до 64,87 доллара, а на SWE-bench Verified среднее усилие и сжатый вывод сократили промпт-токены с 75,2 до 33,7 млн и стоимость примерно на 55%.
Диагностика промахов кэша в Console Отдельный блок рекомендаций касается кэша промпта: Claude Console сравнивает соседние запросы и показывает, где префикс разошёлся, редкие инструменты помечаются defer_loading, правки системного промпта вносятся сообщением по ходу разговора, а прогрев делается запросом с max_tokens: 0. Промах стоит 1,25 от обычной цены ввода на запись кэша и 2 при часовом TTL, который имеет смысл ставить, если инструменты блокируют агента дольше пяти минут.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
