Перейти к содержанию

claude-code

Claude Code научился собирать тесты для ваших приложений

Claude News

Claude Code научился сам писать тест для вашего приложения на Claude, а потом подкручивать приложение, пока оценка не вырастет. Anthropic объявила об этом в посте аккаунта ClaudeDevs в X: команда /claude-api build-eval собирает готовый к запуску эвал, то есть набор проверок из входных данных, способа прогнать на них приложение и грейдера.

Коротко

  • Anthropic сообщила в X, что Claude помогает строить эвалы и улучшать по ним приложения, а советы по устройству эвалов и принципы хиллклайминга выложила отдельной статьёй в блоге для разработчиков.
  • Эвал от build-eval состоит из трёх частей: набора входных данных, способа прогнать ваше приложение на каждом входе и грейдера, то есть проверяющего, который ставит оценку результату.
  • По данным GitHub, перед первым платным прогоном команда останавливается и просит подтвердить входы, метод оценки и стоимость, так что деньги уходят только после вашего явного согласия.

Если вы не следили: по данным Anthropic, инженерный блог компании в начале года выпустил целую серию текстов о методологии эвалов. 9 января 2026 года вышел «Demystifying evals for AI agents», 21 января «Designing AI-resistant technical evaluations», 5 февраля «Quantifying infrastructure noise in agentic coding evals». Там же был разбор «Eval awareness in Claude Opus 4.6's BrowseComp performance». Новая статья опубликована уже в блоге claude.dev, и к ней прилагаются навыки для Claude Code.

build-eval выдаёт готовый к запуску эвал с входами, прогоном и грейдером

Как сказано на GitHub, команда ведёт вас через интервью из четырёх шагов. На шаге 0 вы определяете, что именно оценивается. На шаге 1 решаете, откуда брать промпты: из существующего эвала, из транскриптов или из синтезированных примеров. На шаге 2 выбирается способ оценки, а на шаге 3 появляется исполняемый скрипт с замеренной стоимостью прогона.

Про источники входов блог claude.dev уточняет порядок. Сначала Claude предлагает транскрипты из продакшена, предварительно спросив, как долго вы их храните, и только потом переходит к другим источникам. Перед первым платным запуском, по данным GitHub, команда делает паузу и ждёт вашего согласия по входам, методу оценки и цене.

Там же, на GitHub, описан файл eval-audit.md с чеклистом, который должен пройти любой эвал. Он охватывает устройство задач, обвязки и грейдера, гигиену метрик и то, способен ли эвал вообще заметить проверяемое изменение. Чеклист подгружают обе команды, build-eval и hillclimb.

Каким Anthropic видит хороший эвал?

По данным блога claude.dev, у хорошо устроенного эвала четыре общие черты. Задачи повторяют то, что происходит в продакшене, а результат растёт с более сильной моделью и большим объёмом размышлений. На фронтире остаётся запас: самая сильная модель на максимальном усилии должна набирать заметно меньше 100%. И разброс между прогонами низкий.

Высокий разброс, как пишет блог, чаще всего возникает из-за расплывчатых задач или грейдера, который на одинаковый ответ выносит разные вердикты. Прячется он и в конфигурации, например когда уровень усилия применяется непоследовательно. Ещё один источник назван остатками окружения: забытый файл или история git могут подсказать агенту ответ.

Отдельное предупреждение касается adversarial sampling, отбора задач по принципу «текущая модель на этом падает». Способности модели неровные, объясняет блог claude.dev, и такой набор рискует измерить отпечаток ошибок конкретной модели вместо того, что действительно трудно или ценно. Правило простое: задачу включают, только если человек может заранее объяснить, почему она трудная.

Как hillclimb подтягивает приложение под эвал?

Как сказано на GitHub, /claude-api hillclimb работает с уже готовым эвалом по кругу. Каждый раунд он читает провалы, вносит изменение и заново прогоняет эвал на сплитах train, validation и test. Останавливается он по бюджету и условию остановки, которые вы утверждаете заранее.

Хиллклайминг похож на подъём на холм в густом тумане. Вершины не видно, поэтому каждый шаг сохраняют, только если стало выше. Отложенный test-сплит работает как контрольная отметка, которую по дороге никто не трогал: по ней видно, что вы поднялись на настоящий холм, а не на кочку.

Рядом лежит третья команда, /claude-api cost-optimize. По данным GitHub, она ранжирует способы сократить расходы на API без потери качества, а по запросу применяет изменение и меряет его вашим же эвалом.

Инструкции, как пишут на GitHub, поставляются файлами в папке shared/evals/ скилла claude-api: build-eval.md, eval-audit.md, eval-hillclimb.md и cost-hillclimb.md. К ним приложены runner-scaffold.mjs и build-report-lite.mjs, которые собирают статический report.html. CLI распаковывает их во временную папку в каждой сессии.

В анонсе нет ни одной цифры о результатах: ни того, насколько hillclimb поднимает оценку на реальных приложениях, ни типичной стоимости прогона. Почти всё, что известно об устройстве команд, взято из одного источника, репозитория на GitHub. На наш взгляд, удачнее всего здесь сделана пауза перед первым платным прогоном с замеренной ценой на руках: счёт за эвал хотя бы не придёт сюрпризом.

Перед первым запуском build-eval

По данным GitHub, командам нужна Claude Code CLI версии 2.1.280 или новее, так что начинать придётся с обновления. Как build-eval и hillclimb справляются с большими наборами задач и сколько обычно стоит полный цикл, Anthropic пока не сообщает. Судя по устройству команд, первые ответы каждый увидит в собственном report.html после первого согласованного запуска.

Читайте также

  1. В проекте без CLAUDE.md Claude Code 2.1.277 читает AGENTS.md
  2. Шлюз узнает, какой агент Claude Code прислал запрос
  3. Плагины Claude Code теперь можно прогнать через тесты
  4. Claude Code 2.1.268 синхронизирует тарифы шлюза
  5. Панель Claude Code выносится в отдельное окно
  6. Claude Code 2.1.267 ограничивает уровень усилий

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.