Связка из четырёх моделей Claude решила 78% задач Terminal-Bench 2.1 и заняла седьмое место при счёте $1 178, примерно вдвое дороже первого места. Роли распределены так: Fable 5 планирует и делегирует, Haiku 4.5 ведёт разведку, Opus 5 правит код, Sonnet 5 проверяет работу.
Три задачи по безопасности исполнитель отказался выполнять: ноль решений из 14 делегированных попыток. В контрольном прогоне без делегирования Opus 5 решил те же задачи шесть раз из шести. С зачётом этих задач вышло бы 80,5% и третье место.
С вызовом верификатора задачи решались в 91% случаев, без проверки в 43%. На Opus 5 в роли исполнителя ушло 58% расходов, $689.
Первое место на доске держит Claude Code с Fable 5 и 83,8%.

