Через mitmproxy команда Highflame перехватила собственный трафик Claude Code 2.1.220 и прочитала промпт классификатора безопасности. В режиме --permission-mode auto каждое значимое действие агента оценивает вторая модель claude-sonnet-5: сначала дешёвый вызов на 64 токена со шкалой опасности 0–100, где 50 отсекает действие, затем разбор на 8192 токена.
Около 60% правил печатает команда claude auto-mode defaults, оставшиеся 44 КБ промпта нигде не документированы. В них лежит модель согласия: пользователь обязан назвать сам опасный параметр, а не задачу, которой тот служит. По данным Anthropic, схема даёт 0,4% ложных срабатываний против 17% пропусков.

