anthropic

Из 34 часов модель потратила на задачу около 40 минут

Claude News

anthropic

Одну и ту же исследовательскую задачу по self-distillation (обучение модели на её собственных выводах) автор эксперимента прогнал через два поколения моделей на одном железе. Opus 4.8 получил два дня и три сессии, Fable 5 работал 34 часа подряд.

У Opus набралось шесть ошибок в целевой функции, самопроверка не поймала ни одной. В одном эпизоде модель направила проверку из 97 промптов на живой сервер и убила запуск длиной 1,4 часа на 43-м шаге.

Fable 5 писал план перед каждым запуском и поймал баг ещё на этапе проектирования. Но за 34 часа он ни разу не сверился с целью, а на сам исследовательский вопрос ушло около 40 минут.

Все восемь классов сбоев повторились. Anthropic в материале When AI builds itself утверждала, что более 80% кода в её репозитории написал Claude.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.