anthropic
Старые приёмы промптинга дорожают на Opus 5
Promtime
anthropicAnthropic обновила навык claude-api и добавила в Claude Code команду /claude-api prompt-audit: на бенчмарке клиентской поддержки она снизила стоимость в среднем на 14,6% и подняла точность на 5,3% при переходе с Opus 4.8 на Opus 5. Об этом говорится в публикации Claude, где описаны ещё две команды, cost-optimize и hillclimb.
Коротко
- Кэш промпта хранит внутреннее состояние после префилла, читается только при побайтово совпадающем префиксе на той же модели, а после промаха запись стоит 1,25 обычной цены ввода и вдвое дороже при часовом TTL.
- На FrontierCode Diamond (набор из 50 самых сложных задач) Claude Fable 5 решает 11,5% при низком усилии по 5,35 доллара за задачу и 30,9% при максимальном по 19 долларов.
- Hillclimb, перебирающий модели, уровни усилия и правки промпта, на 14 отложенных тикетах поддержки вывел итоговую конфигурацию на 90,5% против 78,6% у исходной примерно при пятой части расходов.
Рекомендации бьют по инженерной привычке, накопленной за несколько поколений моделей: подпорки в промпте, которые когда-то компенсировали слабости, на новых моделях превращаются в отдельную статью расходов. Судя по всему, Anthropic сдвигает разговор о цене с выбора модели на конфигурацию приложения: кэш, усилие и формулировки дают экономию того же порядка, что и переезд на более дешёвую модель. Для практиков это означает, что промпт стоит перечитывать заново после каждой миграции.
Снятая настройка размышлений заставила API отклонить все запросы маршрутизации
Anthropic взяла чистый промпт для бенчмарка клиентской поддержки и подсадила в него по одному анти-паттерну: снятую настройку размышлений, пару противоречивых правил возврата, ручной блокнот, требование «проверить дважды», установку «быть максимально дотошным» и обязательную процедуру из шести шагов. Получившиеся шесть промптов прогнали на Opus 4.8, на Opus 5 с заменой только идентификатора модели и на Opus 5 после аудита.
Рост точности дали три причины. Снятая настройка размышлений приводила к отказу API на каждом запросе маршрутизации, противоречивые правила заставили Opus 5 придержать четыре положенных возврата ради уточнения у клиента, а ручной блокнот столкнулся со встроенным мышлением: на трёх тикетах модель записала вызов инструмента внутрь рассуждения и не выполнила его.
Экономия пришла из снятых лишних вызовов. Требование «проверить дважды» дублировало поиск заказа на каждом возврате, а установка «быть максимально дотошным» разворачивалась в десятки ненужных обращений к базе знаний. Аудит охватывает промпты, навыки и описания инструментов в рабочем каталоге, включая код приложения и конфигурацию самого Claude Code.
Fable 5.1 при низком усилии повторяет результат Fable 5 при высоком на CursorBench 3.2
На Humanity's Last Exam без инструментов Claude Fable 5.1 набирает около 53% при низком усилии и примерно 0,30 доллара за вопрос и около 61% при максимальном за 2,23 доллара. Кривая круто растёт в начале и почти выполаживается в конце. Последний шаг до максимума добавляет примерно половину пункта при росте затрат на 46%, что укладывается в разброс между прогонами.
На CursorBench 3.2 Fable 5.1 при низком усилии даёт ту же результативность, что Fable 5 при высоком, и обходится втрое дешевле. Причин две: при низком усилии модель делает меньше работы на задачу, а чтение кэша у Fable 5.1 стоит 0,25 доллара за миллион токенов против 1 доллара у Fable 5. Даже по ценам Fable 5 такая конфигурация обошлась бы примерно на 40% дешевле.
Hillclimb довёл Sonnet 5 до 98,9% на обучающей выборке при 1 центе за тикет
Поиск начинался с Opus 4.8 на высоком усилии по умолчанию. Hillclimb перешёл на Opus 5 при низком усилии и применил prompt-audit, получив 98,9% на обучающей выборке при 2,6 цента за тикет; затем спустился к Sonnet 5 за 1 цент, где точность упала до 88,9%, а правила маршрутизации и сверка с лимитом возврата вернули её к 98,9%.
На четырёх публичных бенчмарках с базовым Sonnet 5 команда /claude-api cost-optimize срезала расходы на 52–73% без падения доли прохождения. Больше всех дал tau2-bench retail: явная расстановка точек кэширования убрала 73% стоимости, а на OfficeQA Pro пакетная обработка и кэширование документов снизили счёт со 136,20 до 64,87 доллара.
На LegalBench общий кэшируемый префикс, низкое усилие и обработка через Batch API уронили токены размышлений со 102 779 до 8 284 при экономии около 58%. На SWE-bench Verified среднее усилие и краткие ответы агента сократили медиану шагов с 29 до 17, а токены промпта с 75,2 до 33,7 миллиона, дав около 55%.
Какую из трёх команд запускать
Prompt-audit в Anthropic советуют запускать сразу после переезда на новую модель. Cost-optimize рассчитан на профилирование расходов приложения, которое обращается к Claude API, а hillclimb требует готовой оценки, которую Claude сам делит на обучающую и отложенную части. Остальные рекомендации по кэшу, включая отложенную загрузку редких инструментов и прогрев запросом с max_tokens: 0, собраны в навыке claude-api, документации и кукбуке.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
