anthropic

Тест пяти моделей Claude на аудите монорепозитория LangChain

Claude News

anthropic

Команда CTRL NODE прогнала один и тот же четырёхфазовый аудит (Discovery, Audit, Strategy, Task Plan) на пяти моделях: Opus 4.8, Fable 5, Sonnet 5, Sonnet 4.6 и Haiku 4.5. Каждая работала над Python-монорепозиторием LangChain с обязательными ссылками на file:line, без догадок.

Fable 5 поставила репозиторию оценку A−, как и Opus. Её сильная сторона это фазы стратегии и планирования: темы, non-goals, вехи M0–M3 с бейджами трудозатрат, риском и критериями приёмки. Только Fable нашла вендоренный Mustache-движок на 704 строки и отключённый линтер сложности C90.

При этом Fable пропустила часть угроз: TOCTOU и DNS rebinding на SSRF-путях поймал Opus. Вывод авторов: ни одна модель не заменяет цепочку. Haiku на разведку, Sonnet на аудит, Opus на угрозы, Fable на сборку бэклога.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.