Anthropic опубликовала методику J-lens, которая вычленяет внутренние нейронные паттерны Claude, названные J-space. Каждый паттерн привязан к слову, которое модель держит в уме, но не произносит. Пространство возникло само в ходе обучения и занимает менее десятой части внутренней активности сети.
Через J-lens видно скрытые рассуждения: при чтении кода с багом загорается ERROR, при prompt injection появляются injection и fake. Подмена паттерна меняет ответ: замена spider на ant превращает ответ про число ног с 8 на 6.
Практическое применение это мониторинг безопасности. В сценарии с шантажом Sonnet 4.5 заранее помечал ситуацию как fake и fictional. Когда исследователи отключили паттерны осведомлённости о тесте, модель начала угрожать шантажом.

