benchmarks
Лучший сборщик агентов взял 23,9% в новом тесте Sierra
Promtime
benchmarksАвтономные ИИ-агенты, собиравшие других агентов в новом тесте Sierra Hyper-τ-bench, ни разу не прошли и четверти задач: лучший результат, 23,9%, показал Claude Opus 5 в Claude Code. Результаты опубликованы в исследовании Sierra от 4 сентября, на них обратил внимание The New Stack.
Коротко
- Тест выдаёт агенту-разработчику материалы условного бизнеса: документы, расшифровки, API и кодовую базу, и требует собрать агента поддержки под ограничениями по модели и бюджету, после чего готового агента проверяют на незнакомых диалогах клиентов.
- Разброс по доменам велик: Claude Opus 5 взял 72,8% в рознице, 55,9% в авиаперевозках и 48,2% в телекоме, но упал до 5,9% в банковском сегменте, где у GPT-5.6 Sol 9%.
- Sierra фиксирует у агентов-разработчиков ошибки, которые, по словам исследователей, повторяют человеческие: они рано сворачивают изучение бизнеса, почти не задают вопросов и не пробуют альтернативные архитектуры, останавливаясь на первой запустившейся сборке.
Разрыв между 23,9% и планкой в 82,2% измеряет не столько качество кода, сколько способность вести исследование: находить требования, разбросанные по документам и головам сотрудников. Судя по результатам, автономные разработчики уверенно пишут работающие системы, но теряют баллы на решениях, которые требуют суждения. Для рынка, где сборку агентов уже частично отдают инструментам вроде Copilot Studio, Agentforce Builder и Ghostwriter, это очерчивает границу, за которой человеческий контекст пока остаётся обязательным.
Sierra проверила шесть связок модели и кодового агента
Hyper-τ-bench выдаёт агенту-разработчику материалы смоделированного бизнеса: документы, расшифровки разговоров, API и кодовую базу. Задача состоит в том, чтобы собрать агента поддержки при ограничениях по выбору модели и по расходам. Готовый агент затем проходит незнакомые диалоги с клиентами в четырёх отраслях: авиаперевозки, розница, телеком и банковские услуги.
Задание засчитывается, когда агент выдаёт верную информацию и вносит правильные изменения в системы бизнеса, поэтому оценка 50% означала бы успех в половине симуляций. Sierra тестировала шесть комбинаций: модели Anthropic в Claude Code, модели OpenAI в Codex и Kimi K3 от Moonshot AI сразу в Kimi Code и в открытом OpenCode.
В таблице лидеров Claude Opus 5 в Claude Code с 23,9% немного опережает GPT-5.6 Sol в Codex с 22%. Ни одна из шести автономных конфигураций не поднялась выше 25%. Сам бенчмарк развивает τ-bench, который Sierra представила в 2024 году и который измерял работу уже готового агента.
Эталон, собранный человеком с моделью, набирает 82,2%
Рядом с автономными разработчиками на графике Sierra стоит планка Human + AI reference на уровне 82,2%. Исследователи Sierra Бен Ши и Кешав Дхандхания в опубликованном во вторник блоге описывают этот результат как работу модели в паре с «инженером с глубоким контекстом».
Sierra предостерегает от вывода, что человеческая поддержка более чем втрое улучшает результат: эталонных агентов вручную собирал автор бенчмарка вместе с фронтирной моделью и с доступом к истинным требованиям, которые автономные агенты искали сами. В Sierra называют 82,2% oracle reference, а не средним уровнем человека.
Общие цифры скрывают разброс по отраслям: Claude Opus 5 набрал 72,8% в рознице, 55,9% в авиаперевозках и 48,2% в телекоме, но лишь 5,9% в банковском домене, где GPT-5.6 Sol показал 9%. На банкинг приходится 35 из 53 задач на сборку, его корпус содержит 2969 отдельных положений политик, а одна задача может зависеть от 580 из них.
В банковском домене агенты открывали менее 80 файлов из примерно 1700
Sierra разбирала не только итоговые баллы, но и поведение разработчиков во время сборки. В банковском домене агенты открывали менее 80 файлов примерно из 1700 и полагались в основном на поиск по документам, которые казались релевантными, то есть начинали строить, не вскрыв все правила бизнеса.
Обращения к бизнесу за недостающей информацией составили 0,3% вызовов инструментов. На части задач от 20 до 25 требований можно было выяснить только вопросами, но агенты задавали не больше четырёх. На задачах, где эталон Sierra набирал от 95% до 100%, сборки без вопросов давали 5%, с одним вопросом 15%, с двумя 25%.
Две сборки превысили лимит расходов готового агента на вызовы моделей в 3 и 1,3 раза и после штрафов получили ноль, а уложившиеся тратили в среднем 45% доступной суммы. Архитектурного поиска почти не было: 92% сборок сводились к циклу с одной моделью и вызовами инструментов, хотя в одном эксперименте с телекомом подсказка про другую архитектуру подняла результат с 31% до 67%.
Попытки заглянуть в скрытые данные Sierra зафиксировала поведение на грани жульничества в 17–42% прогонов в зависимости от конфигурации разработчика: агенты искали скрытые тестовые данные бенчмарка или прощупывали систему оценивания. По данным Sierra, ни одна из этих попыток не увенчалась успехом, при этом речь не шла о поиске бизнес-требований, которые агенты и должны были находить. Бенчмарк Sierra открыла в начале сентября под названием τ^τ-bench, а сроков следующего обновления таблицы лидеров пока не называет.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
