claude-code
Плагин Poka-Yoke для Claude Code: 81% против 42%
Claude News
claude-codeАвтор Poka-Yoke выложил на Show HN набор из 11 навыков для Claude Code вместе с бенчмарком: без навыков модель называет, что её собственная правка делает невозможным, в 42% случаев, с навыками в 81%. Показатель посчитан по 80 оценённым вердиктам на шести семействах моделей, репозиторий опубликован на Github.
Коротко
- Плагин переносит на код метод Сигэо Синго: правка, которая держится на чьей-то памяти, комментарий, вики или строка в CLAUDE.md, не считается защитой от ошибки и в отчёте помечается нулевой ступенью.
- Все четыре модели Claude улучшают базовый показатель: Fable 5 на 8,3 п. п., Opus 5 на 3,6, Sonnet 5 на 8,6, Haiku 4.5 на 12,9, и все 95-процентные интервалы исключают ноль.
- Размен измерен на тех же прогонах: конкретное устройство под каждую находку модель предлагает в 100% случаев против 62%, но сырую SQL-интерполяцию опознаёт в 69% против 92%.
Ценность плагина оказывается обратной силе модели: чем меньше у неё запаса, тем больше даёт метод, а на фронтире прирост сжимается до единиц процентов. Это выглядит как общая черта навыков, которые кодируют метод вместо того, чтобы поставлять недостающие знания. Отдельного внимания заслуживает рамка сравнения: базой служит отсутствие навыка, тогда как практическая альтернатива это файл правил, уже написанный в каждом репозитории, и такое сравнение пока не проводилось.
Из 52 ячеек сценарий×модель 30 улучшились, 13 не изменились, 9 ухудшились
Всего в бенчмарке 591 слепо оценённый прогон, на матрицу Claude приходится 445 по 13 сценариям, четырём моделям и двум конфигурациям. Fable 5 идёт с 88,7% до 97,0%, Opus 5 с 92,7% до 96,4%, Sonnet 5 с 79,8% до 88,5%, Haiku 4.5 с 58,2% до 71,1%.
Прирост отслеживает доступный запас: ячейки со стартом ниже 50% выигрывают в среднем 19 п. п., ячейки выше 95% теряют 0,9 п. п. Крупнейшие сдвиги приходятся на самую слабую модель и сценарии сборки, сценарий ops на Haiku 4.5 идёт с 29% до 92%. На задачах сборки та же Haiku 4.5 теряет 8,6 п. п. при более чем двукратном росте времени ответа.
Тот же набор прогонов фиксирует и обратный эффект. С навыками модель в 92% случаев отмечает, что pre-commit обходится и должен подкрепляться CI, против 35% без них, но объясняет, почему тихо неверное число хуже упавшего конвейера, лишь в 31% случаев против 54%.
Прирост на Codex и agy оказался больше, чем на любой из моделей Claude
Плагин поставляется на 19 сред выполнения, у десяти есть собственный манифест, замерены три: Claude Code, Codex и Antigravity. OpenAI Codex на gpt-5.6-terra в песочнице только для чтения идёт с 74,2% до 91,0%, agy на Gemini 3.1 Pro в режиме плана с 64,6% до 78,1% на 12 сценариях из 13.
Результаты по не-Claude средам вынесены отдельно от общей средней: у agy не хватает одного сценария, а ответы сильно расходятся по длине, у Codex это 50–200 слов против 400–800 у Claude. Навык audit на agy не работает вовсе, поскольку режим плана отказывается запускать команду встроенного детектора.
Сами навыки написаны обычным Markdown с относительными ссылками, что и позволяет загружать их в 19 сред вместо одной. Манифесты для остальных сред проверяются в CI только структурно, поведение на самой среде разработчик не тестировал и просит присылать транскрипты сессий в issue.
Ни один из десяти реалистичных запросов не привёл к вызову навыка
Плагин не подхватывается сам. Десяти реалистичным запросам, среди которых удаление рабочего пространства, изоляция арендаторов и пятничная миграция с удалением колонки, свежие агенты с установленным плагином не сопоставили ни одного навыка poka-yoke, в одном случае модель рассуждала о навыках и выбрала hookify.
Метод опирается на две оси. Первая это лестница предпочтений: контроль, при котором ошибка невозможна, предупреждение в момент ошибки, обнаружение постфактум и нулевая ступень для документации. Вторая переводит три способа обнаружения у Синго в различимые типы, исчерпывающий match, машины состояний и ключи идемпотентности.
Детектор опасностей написан на стандартной библиотеке Python 3.9+ и разбирает TypeScript, Python, Go, Rust и SQL. В каталоге 28 форм опасностей, детектор сообщает о 20 из них, за ними стоят 42 правила, из которых по умолчанию включены 19. Установка идёт через команду /plugin marketplace add rainmanjam/poka-yoke, лицензия MIT.
Чего бенчмарк пока не показывает
Слепая оценка, при которой грейдер не видит конфигурацию, контролирует смещение, но не точность, и оценки ставит модель Haiku 4.5. Контрольная ветка, где в контексте был бы другой структурированный метод, спроектирована, но не запущена. Каждый прогон это первый ход свежей сессии, поэтому измеряется потолок метода, а не его устойчивость. Три ячейки держат по одному прогону, сроков следующего прохода разработчик не называет.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
