benchmarks
PR от Claude принимают в 84% случаев, от Devin в 43%
Claude News
benchmarksИсследование по открытому датасету AIDev показало, что пул-реквесты Claude принимаются в 84% случаев, у Codex доля составляет 74%, у Devin 43%, а у людей 85%. Препринт с номером arXiv:2607.21832 опубликован на arXiv 23 июля 2026 года, в качестве отправителя указана Iren Mazloomzadeh.
Коротко
- В основе работы лежит открытый датасет AIDev: авторы сравнивают пул-реквесты от агентов с человеческими, отслеживают динамику разрыва по кварталам и разбирают, на какие задачи агентов ставят чаще всего.
- Разница между Claude и людьми составляет один процентный пункт, тогда как Devin отстаёт от человеческого уровня почти вдвое; Codex занимает промежуточное положение с 74% принятых пул-реквестов.
- Отдельная часть работы сравнивает свойства агентских и человеческих пул-реквестов и то, что из них следует для качества кода, а также прослеживает, как эти свойства меняются со временем.
Доля принятых пул-реквестов остаётся грубым, но редким в открытом виде показателем того, доживает ли код агента до основной ветки. Цифры выглядят так, что главный разрыв проходит не между людьми и агентами вообще, а между самими агентами: выбор инструмента, вероятно, влияет на объём ручной доработки сильнее, чем сам факт перехода на агентную разработку. Продольный срез добавляет вторую ось: важно не только текущее значение, но и то, куда оно движется.
Разброс между тремя агентами составляет 41 процентный пункт: от 43% у Devin до 84% у Claude. Человеческий уровень в 85% превышает лучший из трёх измеренных агентов на один пункт, то есть верхняя граница агентных показателей по этой метрике практически совпадает с человеческой.
В аннотации авторы формулируют проблему так: агентные инструменты уже стали частью рабочих процессов разработки, но их влияние на качество программного обеспечения изучено недостаточно, а то, как вклад агентов меняется на разных стадиях жизненного цикла разработки, подробно не исследовалось. Отсюда и постановка задачи: охарактеризовать агентные пул-реквесты в сравнении с человеческими.
Работа состоит из трёх частей. Сначала на данных AIDev сравнивается динамика долей принятия у агентных и человеческих пул-реквестов во времени. Затем определяются типы задач, на которые агентов ставят чаще всего, и то, как это распределение сдвигается от квартала к кварталу.
Третья часть сравнивает ключевые характеристики агентных и человеческих пул-реквестов с упором на последствия для качества кода и на изменение этих характеристик во времени. Авторы называют итог эмпирическим и продольным взглядом на роль ИИ-агентов в реальной разработке, который уточняет представление о пользе и ограничениях таких инструментов.
Что не раскрыто в аннотации
Аннотация не приводит ни поквартальных значений, ни перечня типов задач, ни набора сравниваемых характеристик: они остаются в полном тексте препринта. Первая версия подана 23 июля 2026 года и отнесена к разделам «Программная инженерия» и «Машинное обучение». Работа зарегистрирована под идентификатором arXiv:2607.21832v1.
Комментарии
Пока никто не написал. Будьте первым.
Присоединяйтесь к разговору
Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.
Из Google мы используем только имя и аватар. Почту не сохраняем.
