Более слабая модель может поднять безопасность более сильной. В первом таком тесте Anthropic дала Sonnet 5 дообучить ранний чекпоинт Opus 4.8, и по оценкам безопасности он подошёл близко к рабочему Opus 4.8, прошедшему полное обучение на выравнивание.
До этого Claude получил 48 часов и один GPU на небольших моделях. Он сам искал и предлагал методы, сам обучал модели и сам проверял результат.
Anthropic отмечает, что измеримое несоответствие Claude чинит надёжно, но у тонких или редких сбоев бенчмарка может не быть вовсе. Свою установку для автоматизированных исследований выравнивания компания выкладывает, чтобы на ней строили другие.

