Перейти к содержанию

claude-code

В Claude Code низкий effort чаще задаёт вопросы

Claude News

Автор разбора про effort в Claude Code признаётся в посте в Twitter, что после собственных тестов гораздо чаще сидит на low. Max он включает почти только в двух случаях: когда вообще не хочет участвовать в работе или когда ищет уязвимости, хотя вопрос в посте звучит так, будто максимум логично ставить всегда.

Коротко

  • Полная версия разбора вышла в новом блоге для разработчиков claude.dev, там лежат интерактивные объяснения бенчмарков и демо, которые автор собрал, пока гонял effort на evals и обычной работе.
  • Effort, по данным claude.com, задаёт, сколько токенов Claude потратит на ответ, а на low модель скорее попросит у вас недостающий контекст, чем станет разбираться сама, поэтому вы остаётесь в процессе.
  • В самом посте цифр нет, а прирост от высокого effort, как сообщает claude.com, давал лучшие результаты там, где полезны проверки и крайние случаи: в железе, ревью кода и безопасности.

Если вы не следили: идея регулировать, сколько Claude думает, появилась вместе с Claude 3.7 Sonnet. Как писали в Anthropic, тогда пользователи получили переключатель режима extended thinking для трудных вопросов, а разработчики смогли задавать «бюджет на размышления» и точно контролировать, сколько времени Claude тратит на задачу. По данным Anthropic, рассуждения тогда же показали в сыром виде, чтобы ответы было проще понимать и проверять.

Max автор оставил для двух случаев: работа без участия человека и поиск уязвимостей

Главный вывод поста идёт вразрез с интуицией. Автор изучил evals, провёл собственные тесты и сам удивился результатам. В итоге low он включает намного чаще, если хочет оставаться в цикле, а max нужен ему, только когда вмешиваться не хочется совсем или когда цель в поиске уязвимостей.

Объяснение кроется в том, что делает effort. По данным claude.com, параметр задаёт, сколько токенов Claude потратит на ответ, то есть даёт модели примерную оценку того, сколько вычислений вы готовы отдать задаче. Там же сказано, что на low Claude скорее спросит у вас контекст, чем станет выяснять всё сам.

Представьте, что вы заказываете смету у подрядчика. Дадите ему час, и он позвонит уточнить детали. Дадите неделю, и он сам объедет объект, всё промерит и принесёт готовый вариант, но и счёт выставит соответствующий.

Лишние токены, как утверждает claude.com, окупались в областях, где особенно полезны проверки и прогон крайних случаев: в железе, ревью кода и безопасности. Именно там, по тем же данным, дополнительный effort давал лучшие результаты. На обычных задачах автор, напомним, чаще остаётся на low.

Цифры автор вынес в блог claude.dev вместе с интерактивными демо

В блоге claude.dev, по данным автора, для сравнения взят Terminal-Bench 3.0: одни и те же 70 задач для каждой модели, задачи на GPU исключены. Кривые effort у Fable 5.1 и Opus 5.5 он называет лучшими на сегодня: на каждом следующем уровне растут и баллы в бенчмарке, и расход токенов. Opus 5.5 прогоняли примерно на три недели позже, с ответами до 128 тысяч токенов и без доступа к GitHub и PyPI.

Нагляднее всего пример из того же блога claude.dev с редизайном меню /config в Claude Code. На low работа заняла одну минуту, и получился интерактивный набросок, который передавал идею, но мало походил на Claude Code. На max ушло 28 минут, зато макет выглядел уже очень похоже на Claude Code.

Как effort связан с бюджетом на размышления?

Через бюджет токенов, который в документации Claude Platform описан так: на каждый запрос задаётся параметр thinking с полем budget_tokens, и Claude думает в пределах этого бюджета до начала итогового ответа. Минимум составляет 1 024 токена, меньшие значения API отклоняет, а бюджет должен быть меньше max_tokens, потому что токены размышлений входят в лимит хода.

Там же, в документации, Claude Opus 4.5 названа единственной моделью только с extended thinking, которая поддерживает effort. На ней обе настройки задаются отдельно: effort определяет ответ целиком, budget_tokens отвечает за глубину размышлений.

По описанию MindStudio, в Claude Code четыре уровня, low, medium, high и max, и каждый определяет, сколько токенов уйдёт на размышления до первого слова ответа. Medium, как пишет MindStudio, в большинстве конфигураций стоит по умолчанию, а на max один и тот же промпт иногда съедает в 10 раз больше токенов, чем на low, а то и больше.

Слабое место разбора в том, что сам пост держится на словах: цифр прироста в нём нет, а бенчмарк описывает одну выборку из 70 задач без GPU, причём Opus 5.5 прогоняли позже и в других условиях. На наш взгляд, главный практический вывод здесь про low: вопросы от модели на этом уровне стоит считать экономией, а не недостатком. Судя по примеру с меню, max покупает качество временем, 28 минут против одной.

Когда ставить max в своём проекте

Практическая проверка остаётся за вами: задачи на ревью, безопасность и железо имеет смысл попробовать на высоком effort, а остальное оставить на low или medium и смотреть, сколько вопросов задаёт Claude. Какие именно цифры стоят за приростом в безопасности, в посте не сказано. Изменится ли уровень по умолчанию в Claude Code после таких тестов, из опубликованного пока не ясно.

Читайте также

  1. Claude iOS показывает предупреждение для Max effort
  2. Правила из CLAUDE.md предлагают заменить линт-правилами в CI
  3. Полный справочник команд Claude Code
  4. Claude Code 2.1.283 научился держать новые модели за дверью
  5. claude.ai разогнали в 3 раза за две недели с помощью Claude
  6. Claude Code не читает AGENTS.md, если выключить телеметрию

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.