Исследователи Highflame направили трафик Claude Code в mitmproxy и прочитали системный промпт второй модели, claude-sonnet-5, которая в режиме auto оценивает действия агента на версии 2.1.220. Около 44 КБ этого промпта не печатается командой claude auto-mode defaults.
Проверка идёт в два вызова. Сортировка с лимитом 64 токена ставит оценку вреда от 0 до 100 при пороге блокировки 50, спорное уходит на разбор с лимитом 8192. Anthropic сообщает о 0,4% ложных срабатываний против 17% пропусков.
В скрытой части описан приём cross-session permission laundering (отмывание разрешений): просьба от другой сессии Claude выполнить то, что ей запретили, отклоняется.
В большинстве сессий на 2.1.208 и новее отказ выводит фиксированную строку «Blocked by classifier» без имени сработавшего правила.

