claude-code

config-drift-checker тестирует настройки Claude Code

Claude News

claude-code

Открытый config-drift-checker запускает регрессионные тесты для CLAUDE.md, skills и hooks в Claude Code при каждом обновлении среды, а проверка новых версий выполняется каждые 6 часов.

Инструмент работает через собственный GitHub Actions и API-ключ команды. По описанию в GitHub, тесты запускаются в отдельной копии репозитория, а данные не покидают его пределы.

Коротко

  • Утилита сама извлекает настройки проекта и превращает их в тесты для изменений кода, срабатывания skills и блокировки опасных команд.
  • Каждый сценарий проходит три запуска с подключённым плагином, а отчёт сохраняет оценки, причины решений, вызовы инструментов и ответ судьи.
  • Бесплатный открытый код работает в GitHub Actions, тогда как размещённый сервис стоит от 49 до 399 долларов в месяц.

Для Claude Code конфигурация становится частью инженерной системы, но обычно остаётся без отдельного контроля после изменения инструкций или hooks. Такой подход переводит проверку поведения агента из ручного наблюдения в повторяемый процесс, где виден не только итоговый балл, но и причина результата. Это особенно существенно при обновлениях среды, когда внешнее изменение может затронуть локальные правила проекта.

config-drift-checker создаёт тесты из уже существующих правил проекта

Установка состоит из добавления marketplace, установки плагина и запуска команды setup внутри Claude Code. После этого config-drift-checker читает CLAUDE.md, skills и hooks, которые уже есть в репозитории. На их основе он записывает первые сценарии, включая реальное изменение кода, запрос, который не должен активировать skill, и команду, которую guard hook обязан заблокировать.

Каждый сценарий запускается несколько раз в одноразовой копии репозитория с загруженным плагином. Для каждого прогона grader фиксирует вердикт и объяснение, а judge model описывает увиденное. Формат кейсов совпадает с форматом eval для claude plugin от Anthropic, поэтому существующие тесты можно использовать без отдельного формата инструмента и последующей миграции.

Проверка релизов Claude Code запускается каждые 6 часов и сравнивается с baseline

Небольшая задача проверяет npm каждые 6 часов. Когда выходит новая версия Claude Code, suite запускается на ней, сравнивает результаты с baseline и отмечает проверку как неуспешную, если поведение изменилось. Результаты можно отправлять в Slack. Для уже подготовленных кейсов или подключения к существующему pipeline достаточно добавить action одной строкой.

Первый отчёт на небольшом сервисе Spring Boot показал разницу между запуском с настройками команды и без них. Для команды, которую guard hook должен блокировать, итог составил 1.000 с настройками и 0.33 без них. Для добавления endpoint через service, DTO и controller результаты были 1.000 и 0.50 соответственно.

Три запуска выявили пользу hooks и conventions skill без ложных срабатываний

Тест запроса Dockerfile получил 1.000 в обоих вариантах, поскольку backend skill не активировался ни с настройками, ни без них. В отчёте каждый кейс представлен отдельными запусками, оценками grader и объяснением judge, поэтому одинаковый балл не считается достаточным описанием причины.

Авторы отдельно отмечают случай, когда тест hook прошёл потому, что модель сама отказалась выполнить команду ещё до срабатывания hook. Результат выглядел правильным, но проверял другой механизм. Сохранение причин, вызовов инструментов и ответов модели помогает отличить фактическое enforcement-правило от случайного отказа агента.

Размещённый сервис добавляет историю релизов и тарифы от 49 долларов

Плагин и GitHub Action остаются бесплатными и открытыми. Hosted-сервис предназначен для команд, которые запускают проверки в нескольких репозиториях и хотят видеть историю всех проектов и версий Claude Code в одном месте. В него входят график оценок по релизам и release-watch без собственного GitHub Actions, а расширенные планы добавляют проверки через Codex и Cursor.

Тариф Starter стоит 49 долларов в месяц и рассчитан на один репозиторий, 90 дней истории и Claude Code. Team за 149 долларов даёт неограниченное число репозиториев, год истории и Claude Code, Codex и Cursor. Business стоит 399 долларов, добавляет неограниченную историю, SAML, private runner и audit export для enforcement hooks. Запуски агентов оплачиваются собственным API-ключом команды.

Бета по цене Starter

Первые команды смогут подготовить свой suite вместе с авторами, а участие в бета-тестировании заявлено по цене тарифа Starter. Дата перехода к стабильной версии и условия после беты в описании не указаны. Для одиночного репозитория остаётся бесплатный путь через открытый плагин и GitHub Actions.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.