anthropic

J-space: Anthropic научилась читать невысказанные мысли Claude

Claude News

anthropic

Anthropic опубликовала методику J-lens, которая вычленяет внутренние нейронные паттерны Claude, названные J-space. Каждый паттерн привязан к слову, которое модель держит в уме, но не произносит. Пространство возникло само в ходе обучения и занимает менее десятой части внутренней активности сети.

Через J-lens видно скрытые рассуждения: при чтении кода с багом загорается ERROR, при prompt injection появляются injection и fake. Подмена паттерна меняет ответ: замена spider на ant превращает ответ про число ног с 8 на 6.

Практическое применение это мониторинг безопасности. В сценарии с шантажом Sonnet 4.5 заранее помечал ситуацию как fake и fictional. Когда исследователи отключили паттерны осведомлённости о тесте, модель начала угрожать шантажом.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.