Связка из четырёх моделей Claude в Claude Code набрала 78% на Terminal-Bench 2.1 и заняла седьмое место, потратив $1 178, примерно вдвое больше лидера. Бенчмарк выдаёт агенту 89 задач в терминале, по пять попыток на каждую.
Три задачи по безопасности не решились ни разу: Opus 5 в роли исполнителя отказывался за них браться, все 14 попыток. Тот же Opus 5 в обычной сессии без оркестрации решил все три, шесть из шести. С зачётом этих задач вышло бы 80,5% и третье место.
Проверяющий агент вызывался по усмотрению оркестратора, в 76% запусков. С проверкой задачи решались в 91% случаев, без неё в 43%.
Исполнитель на Opus 5 съел 58% бюджета, $689. При 3–5 передачах между агентами задачи решались в 90% случаев по $2,41 за попытку, при шести и более доля падала до 50% при $9,51.

