claude-code
Context Engineering Kit: /reflect и спецификации arc42
Claude News
claude-codeКомпания NeoLabHQ опубликовала на Github маркетплейс Context Engineering Kit: 13 плагинов для Claude Code, каждый из которых загружает в контекст только собственных агентов, команды и навыки, без пересечений и дублирования. Замеры надёжности приведены авторами по итогам более чем года использования набора на реальных production-проектах.
Коротко
- Маркетплейс подключается командой /plugin marketplace add, после чего плагины ставятся по одному: установка самого маркетплейса не загружает в контекст ни одного агента и ни одного навыка.
- По таблице авторов, на правках в 20+ файлов одиночный промпт даёт 1-20% полностью точных результатов, /do-in-steps 50%, а связка /plan-task с ревью человека и /implement-task 95%.
- Плагин sdd строит спецификацию по стандарту arc42 и раскладывает работу между агентами researcher, code-explorer, business-analyst, software-architect, tech-lead, developer, code-reviewer и tech-writer, каждый из которых включается на своей фазе.
Ставка набора в том, что качество упирается не в модель, а в устройство контекста: изоляция подагентов, судьи и файловая память гасят деградацию на длинных задачах. Проценты в таблице представляют собой самозамеры авторов, внешней проверки у них нет, и относиться к ним стоит как к ориентиру. Главное в ней другое: рост точности оплачивается токенами, и разброс накладных расходов от 1k токенов у /reflect до 35-кратного у полного цикла со спецификацией делает эту цену явной.
Одиночный промпт на правках в 20+ файлов даёт 1-20% полностью точных результатов
Авторы сводят подходы в таблицу вероятности получить полностью корректный результат без галлюцинаций в зависимости от числа изменённых файлов. На правках в 1-3 файла одиночный промпт даёт 60-80%, /reflect 68-91%, связка /reflect и /memorize 79-87%, /do-and-judge 90%, /do-in-steps 92%, а /plan-task с /implement-task 94%.
Для изменений в 20+ файлах разрыв шире: одиночный промпт 1-20%, /reflect 1-30%, /do-and-judge 30%, /do-in-steps 50%, /plan-task с /implement-task 70%, добавленный /brainstorm 80%, а ревью спецификации человеком поднимает показатель до 95%. Накладные расходы растут с 1k-3k токенов у /reflect до 5x-35x у сценария с человеком.
Промежуточные варианты отличаются механикой: /memorize вытаскивает повторяющиеся ошибки в память проекта, /do-and-judge гоняет реализацию через независимого судью с повтором до прохождения, а /do-in-steps делает то же самое отдельно по группам файлов, тогда как спецификация в /plan-task снимает проблемы несогласованной архитектуры.
Плагин sdd ведёт задачу тремя командами и восемью агентами
Работа строится вокруг трёх команд. /add-task создаёт файл задачи в .specs/tasks/draft с исходным промптом, /plan-task прогоняет исследование, разбор кодовой базы, сбор требований, проектирование архитектуры и декомпозицию на шаги, после чего задача переезжает в .specs/tasks/todo, а /implement-task выдаёт реализацию и переносит файл в .specs/tasks/done.
В версии 3.1.0 в агента developer встроили правила DDD и SOLID и добавили отдельного агента code-reviewer, который проверяет фазу по критериям приёмки, практикам функционального и объектно-ориентированного кода и анализу потерь Muda. Спецификацию можно править вручную или комментариями через //, затем перезапустив /plan-task с флагом --refine; флаг --human-in-the-loop включает проверку человеком на каждой фазе.
По заметкам к релизу 2.0.0, переписанный с нуля плагин выдаёт работающий код в 99% случаев на реальных production-проектах. Разработчики отмечают, что набор рассчитан скорее на крупные и сложные кодовые базы, поскольку на каждой фазе планирования выполняется анализ влияния на существующий код.
Reflexion опирается на Self-Refine с заявленным приростом качества 8-21%
Плагин reflexion добавляет команды /reflect, /memorize и /critique, а хук сам запускает рефлексию, если слово reflect встречается в промпте; для хука нужен установленный bun, для самой команды нет. Основанием служат работы Self-Refine и Reflexion, где циклы обратной связи улучшали результат на 8-21% по автоматическим метрикам и человеческим предпочтениям на семи задачах, а также Agentic Context Engineering с приростом 10,6% в агентных приложениях.
Остальные плагины покрывают ревью кода шестью специализированными агентами с интеграцией в GitHub Actions, git-операции, TDD, Kaizen-разбор причин, документацию, настройку MCP-серверов и правила TypeScript, подключающиеся при чтении и записи .ts-файлов. FPF реализует цикл абдукции, дедукции и индукции по методологии Анатолия Левенчука и грузит спецификацию объёмом около 600k токенов в подагента на модели Sonnet[1m].
Что даёт установка вне Claude Code
В Gemini CLI набор ставится расширением из репозитория, в Antigravity CLI командой agy plugin install из папки antigravity, и в обоих случаях это единый пакет со всеми навыками и агентами: выбирать отдельные плагины эти инструменты не умеют, лишнее приходится удалять после установки. Для Cursor, Codex и OpenCode предлагается npx skills add, который не поддерживает подагентов. Сроков появления поштучной установки в этих клиентах авторы не называют.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
