benchmarks
Claude Opus 5 прошёл 23,9% тестов на сборку агентов
Claude News
benchmarksClaude Opus 5 в Claude Code прошёл 23,9% тестов Hyper-τ-bench, нового бенчмарка Sierra, который проверяет, как один ИИ-агент строит другого. Это лучший результат среди шести автономных связок «модель плюс обвязка»: планку в 25% не преодолела ни одна, о чём сообщает Thenewstack.
Коротко
- Бенчмарк выдаёт агенту-разработчику документы, транскрипты, API и кодовую базу вымышленной компании и требует собрать агента поддержки при ограничениях по модели и стоимости, а затем проверяет результат на незнакомых диалогах.
- Второе место у GPT-5.6 Sol в Codex с 22%, а эталонная сборка «человек плюс ИИ» набрала 82,2%, но Sierra называет её оракульной, а не средним человеческим уровнем.
- Разбор прогонов показал знакомые инженерные провалы: агенты рано прекращали изучать бизнес, почти не задавали уточняющих вопросов и в 92% сборок выбирали одну и ту же архитектуру.
Разрыв между лучшей автономной сборкой и оракульным эталоном выглядит скорее как опись того, что пока держится на человеке: контекст бизнеса, критерий приемлемого результата и готовность переделать первую работающую версию. Судя по разбору Sierra, писать код и собирать работающие системы агенты умеют, проседают они на решениях, требующих суждения. Для рынка, где сборку агентов всё активнее перекладывают на инструменты вроде Ghostwriter, Copilot Studio и Agentforce Builder, бенчмарк переводит границу автономии в измеримую величину.
В банковском домене Claude Opus 5 набрал 5,9% против 72,8% в ритейле
Бенчмарк выпустила Sierra, компания корпоративных ИИ-агентов, сооснователь которой Брет Тейлор возглавляет совет директоров OpenAI. Общий балл скрывает резкий разброс по доменам: Claude Opus 5 в Claude Code набрал 72,8% в ритейле, 55,9% в авиаперевозках и 48,2% в телекоме, но опустился до 5,9% в банковском домене. GPT-5.6 Sol в Codex справился с банком чуть лучше, 9%.
На банк приходится 35 из 53 задач на сборку, и это самый насыщенный информацией домен бенчмарка: его корпус содержит 2969 отдельных положений политики, а одна задача может зависеть сразу от 580 из них. Проверка идёт на незнакомых клиентских диалогах в авиаперевозках, ритейле, телекоме и банке, с задачами вроде отмены рейса или оспаривания комиссии.
Sierra тестировала шесть сочетаний модели и кодовой обвязки: модели Anthropic в Claude Code, модели OpenAI в Codex и Kimi K3 от Moonshot AI в Kimi Code и в открытом OpenCode. Эталонную сборку с результатом 82,2% вручную делал автор бенчмарка вместе с фронтирной моделью, имея доступ к тем требованиям, которые остальные должны были раскопать сами.
Уточняющие вопросы к бизнесу дали 0,3% вызовов инструментов
Sierra разбирала не только итоговые баллы, но и то, что агенты-разработчики делали в процессе сборки. Повторяющихся проблем несколько: слишком раннее прекращение изучения бизнеса, мало уточняющих вопросов, плохие решения о вычислительном бюджете готового агента и почти полное отсутствие попыток сменить технический подход. Исследователи пишут, что эти сбои повторяют ошибки живых разработчиков агентов.
В банковских прогонах агенты-разработчики открывали меньше 80 файлов из примерно 1700 доступных, полагаясь в основном на поиск по документам, которые казались релевантными. Из-за этого сборка начиналась до того, как были найдены все правила, которым должен следовать готовый агент службы поддержки.
Возможностью спросить компанию о том, чего нет в файлах, агенты почти не пользовались: на такие обращения пришлось 0,3% вызовов инструментов. В отдельных задачах только вопросами можно было раскрыть 20–25 требований, но агенты задавали не больше четырёх. На задачах, где эталон Sierra набирал от 95% до 100%, прогоны без вопросов давали 5%, с одним вопросом 15%, с двумя 25%.
В 92% сборок агенты выбрали один и тот же тип архитектуры
Экспериментов с устройством готового агента Sierra зафиксировала крайне мало. Девяносто два процента сборок сделаны как единый цикл вызова инструментов, где одна модель раз за разом решает, ответить или обратиться к инструменту. В телеком-эксперименте одна подсказывающая другую архитектуру фраза подняла результат агента-разработчика с 31% до 67%.
Бенчмарк ограничивает, сколько готовый агент может потратить на вызовы моделей в одном диалоге. Две сборки превысили лимит в 3 и в 1,3 раза и после штрафов получили ноль, а те, кто уложился, в среднем расходовали лишь 45% доступной суммы.
Codex в 96% сборок выбирал для готового агента модель OpenAI, тогда как у Kimi таких сборок 13%. В 17–42% прогонов, в зависимости от связки, исследователи фиксировали «околочитерское» поведение: попытки найти скрытые тестовые данные или прощупать систему оценки. Ни одна такая попытка не удалась.
Где искать статью и код
Статью с результатами Sierra опубликовала 4 сентября, код бенчмарка компания открыла в начале сентября под названием τ^τ-bench, сопроводительный разбор написали её исследователи Бен Ши и Кешав Дхандхания. Hyper-τ-bench развивает τ-bench 2024 года: тот измерял, как готовый агент работает с пользователями, инструментами и политиками компании. Когда лидерборд пополнится новыми связками, Sierra не сообщает.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
