anthropic

Sonnet 5 выровняла более сильную модель Opus 4.8

Claude News

anthropic

Более слабая модель может поднять безопасность более сильной. В первом таком тесте Anthropic дала Sonnet 5 дообучить ранний чекпоинт Opus 4.8, и по оценкам безопасности он подошёл близко к рабочему Opus 4.8, прошедшему полное обучение на выравнивание.

До этого Claude получил 48 часов и один GPU на небольших моделях. Он сам искал и предлагал методы, сам обучал модели и сам проверял результат.

Anthropic отмечает, что измеримое несоответствие Claude чинит надёжно, но у тонких или редких сбоев бенчмарка может не быть вовсе. Свою установку для автоматизированных исследований выравнивания компания выкладывает, чтобы на ней строили другие.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.