benchmarks

Четыре модели Claude в связке дали 78% на Terminal-Bench

Claude News

benchmarks

Связка из четырёх моделей Claude решила 78% задач Terminal-Bench 2.1 и заняла седьмое место при счёте $1 178, примерно вдвое дороже первого места. Роли распределены так: Fable 5 планирует и делегирует, Haiku 4.5 ведёт разведку, Opus 5 правит код, Sonnet 5 проверяет работу.

Три задачи по безопасности исполнитель отказался выполнять: ноль решений из 14 делегированных попыток. В контрольном прогоне без делегирования Opus 5 решил те же задачи шесть раз из шести. С зачётом этих задач вышло бы 80,5% и третье место.

С вызовом верификатора задачи решались в 91% случаев, без проверки в 43%. На Opus 5 в роли исполнителя ушло 58% расходов, $689.

Первое место на доске держит Claude Code с Fable 5 и 83,8%.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.