anthropic

Делегирование в Claude Code включило отказы Opus 5

Promtime

anthropic

Связка из четырёх моделей Claude в Claude Code набрала 78% на Terminal-Bench 2.1 и заняла седьмое место, потратив $1 178, примерно вдвое больше лидера. Бенчмарк выдаёт агенту 89 задач в терминале, по пять попыток на каждую.

Три задачи по безопасности не решились ни разу: Opus 5 в роли исполнителя отказывался за них браться, все 14 попыток. Тот же Opus 5 в обычной сессии без оркестрации решил все три, шесть из шести. С зачётом этих задач вышло бы 80,5% и третье место.

Проверяющий агент вызывался по усмотрению оркестратора, в 76% запусков. С проверкой задачи решались в 91% случаев, без неё в 43%.

Исполнитель на Opus 5 съел 58% бюджета, $689. При 3–5 передачах между агентами задачи решались в 90% случаев по $2,41 за попытку, при шести и более доля падала до 50% при $9,51.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.