claude-code

Плагин Poka-Yoke для Claude Code: 81% против 42%

Claude News

claude-code

Автор Poka-Yoke выложил на Show HN набор из 11 навыков для Claude Code вместе с бенчмарком: без навыков модель называет, что её собственная правка делает невозможным, в 42% случаев, с навыками в 81%. Показатель посчитан по 80 оценённым вердиктам на шести семействах моделей, репозиторий опубликован на Github.

Коротко

  • Плагин переносит на код метод Сигэо Синго: правка, которая держится на чьей-то памяти, комментарий, вики или строка в CLAUDE.md, не считается защитой от ошибки и в отчёте помечается нулевой ступенью.
  • Все четыре модели Claude улучшают базовый показатель: Fable 5 на 8,3 п. п., Opus 5 на 3,6, Sonnet 5 на 8,6, Haiku 4.5 на 12,9, и все 95-процентные интервалы исключают ноль.
  • Размен измерен на тех же прогонах: конкретное устройство под каждую находку модель предлагает в 100% случаев против 62%, но сырую SQL-интерполяцию опознаёт в 69% против 92%.

Ценность плагина оказывается обратной силе модели: чем меньше у неё запаса, тем больше даёт метод, а на фронтире прирост сжимается до единиц процентов. Это выглядит как общая черта навыков, которые кодируют метод вместо того, чтобы поставлять недостающие знания. Отдельного внимания заслуживает рамка сравнения: базой служит отсутствие навыка, тогда как практическая альтернатива это файл правил, уже написанный в каждом репозитории, и такое сравнение пока не проводилось.

Из 52 ячеек сценарий×модель 30 улучшились, 13 не изменились, 9 ухудшились

Всего в бенчмарке 591 слепо оценённый прогон, на матрицу Claude приходится 445 по 13 сценариям, четырём моделям и двум конфигурациям. Fable 5 идёт с 88,7% до 97,0%, Opus 5 с 92,7% до 96,4%, Sonnet 5 с 79,8% до 88,5%, Haiku 4.5 с 58,2% до 71,1%.

Прирост отслеживает доступный запас: ячейки со стартом ниже 50% выигрывают в среднем 19 п. п., ячейки выше 95% теряют 0,9 п. п. Крупнейшие сдвиги приходятся на самую слабую модель и сценарии сборки, сценарий ops на Haiku 4.5 идёт с 29% до 92%. На задачах сборки та же Haiku 4.5 теряет 8,6 п. п. при более чем двукратном росте времени ответа.

Тот же набор прогонов фиксирует и обратный эффект. С навыками модель в 92% случаев отмечает, что pre-commit обходится и должен подкрепляться CI, против 35% без них, но объясняет, почему тихо неверное число хуже упавшего конвейера, лишь в 31% случаев против 54%.

Прирост на Codex и agy оказался больше, чем на любой из моделей Claude

Плагин поставляется на 19 сред выполнения, у десяти есть собственный манифест, замерены три: Claude Code, Codex и Antigravity. OpenAI Codex на gpt-5.6-terra в песочнице только для чтения идёт с 74,2% до 91,0%, agy на Gemini 3.1 Pro в режиме плана с 64,6% до 78,1% на 12 сценариях из 13.

Результаты по не-Claude средам вынесены отдельно от общей средней: у agy не хватает одного сценария, а ответы сильно расходятся по длине, у Codex это 50–200 слов против 400–800 у Claude. Навык audit на agy не работает вовсе, поскольку режим плана отказывается запускать команду встроенного детектора.

Сами навыки написаны обычным Markdown с относительными ссылками, что и позволяет загружать их в 19 сред вместо одной. Манифесты для остальных сред проверяются в CI только структурно, поведение на самой среде разработчик не тестировал и просит присылать транскрипты сессий в issue.

Ни один из десяти реалистичных запросов не привёл к вызову навыка

Плагин не подхватывается сам. Десяти реалистичным запросам, среди которых удаление рабочего пространства, изоляция арендаторов и пятничная миграция с удалением колонки, свежие агенты с установленным плагином не сопоставили ни одного навыка poka-yoke, в одном случае модель рассуждала о навыках и выбрала hookify.

Метод опирается на две оси. Первая это лестница предпочтений: контроль, при котором ошибка невозможна, предупреждение в момент ошибки, обнаружение постфактум и нулевая ступень для документации. Вторая переводит три способа обнаружения у Синго в различимые типы, исчерпывающий match, машины состояний и ключи идемпотентности.

Детектор опасностей написан на стандартной библиотеке Python 3.9+ и разбирает TypeScript, Python, Go, Rust и SQL. В каталоге 28 форм опасностей, детектор сообщает о 20 из них, за ними стоят 42 правила, из которых по умолчанию включены 19. Установка идёт через команду /plugin marketplace add rainmanjam/poka-yoke, лицензия MIT.

Чего бенчмарк пока не показывает

Слепая оценка, при которой грейдер не видит конфигурацию, контролирует смещение, но не точность, и оценки ставит модель Haiku 4.5. Контрольная ветка, где в контексте был бы другой структурированный метод, спроектирована, но не запущена. Каждый прогон это первый ход свежей сессии, поэтому измеряется потолок метода, а не его устойчивость. Три ячейки держат по одному прогону, сроков следующего прохода разработчик не называет.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.