Одну и ту же исследовательскую задачу по self-distillation (обучение модели на её собственных выводах) автор эксперимента прогнал через два поколения моделей на одном железе. Opus 4.8 получил два дня и три сессии, Fable 5 работал 34 часа подряд.
У Opus набралось шесть ошибок в целевой функции, самопроверка не поймала ни одной. В одном эпизоде модель направила проверку из 97 промптов на живой сервер и убила запуск длиной 1,4 часа на 43-м шаге.
Fable 5 писал план перед каждым запуском и поймал баг ещё на этапе проектирования. Но за 34 часа он ни разу не сверился с целью, а на сам исследовательский вопрос ушло около 40 минут.
Все восемь классов сбоев повторились. Anthropic в материале When AI builds itself утверждала, что более 80% кода в её репозитории написал Claude.

