benchmarks

Доля влитых PR: Claude 84%, люди 85%, Devin 43%

Promtime

benchmarks

Пул-реквесты, созданные Claude, вливают в основную ветку в 84% случаев, почти вровень с разработчиками-людьми, у которых этот показатель равен 85%. Сравнение агентских и человеческих пул-реквестов провели на датасете AIDev, препринт arXiv:2607.21832 опубликован на Arxiv.

Коротко

  • Сравнение не ограничивается разовым срезом: разрыв в доле влитых пул-реквестов между ИИ-агентами и разработчиками-людьми авторы прослеживают во времени и по стадиям жизненного цикла разработки на данных датасета AIDev.
  • Между самими агентами расхождение крупнее: у Devin доля влитых пул-реквестов 43%, то есть до основной ветки доходит меньше половины предложенных им изменений, при 84% у Claude.
  • Помимо доли слияний авторы сопоставляют характеристики агентских и человеческих пул-реквестов, значимые для качества кода, и смотрят, как эти характеристики и набор решаемых агентами задач меняются от квартала к кварталу.

Цифры расшатывают привычную рамку, в которой агентский код по умолчанию считается второсортным. Судя по данным препринта, вопрос смещается с того, допускать ли агентов в репозиторий, к тому, какой именно агент работает с кодовой базой: у одних доля принятых изменений почти человеческая, у других близка к половине. При этом доля слияний фиксирует только факт принятия изменений, а качество кода в работе разбирается отдельным блоком.

Devin в этом сравнении отстаёт заметнее всего из трёх названных случаев: 43% влитых пул-реквестов против 84% у Claude и 85% у разработчиков-людей. Разница между Claude и Devin составляет 41 процентный пункт, тогда как между Claude и людьми она равна одному пункту.

Авторы исходят из того, что после быстрого распространения больших языковых моделей ИИ-агенты стали штатной частью процессов разработки, но их влияние на качество программного обеспечения изучено недостаточно. Отдельно в работе отмечается, что эволюция агентского вклада по стадиям жизненного цикла разработки прежде подробно не рассматривалась.

Разбор построен в три шага и опирается на датасет AIDev. Сначала авторы смотрят, как разница в доле слияний между агентскими и человеческими пул-реквестами меняется во времени. Затем они выделяют типы задач разработки, на которые ИИ-агентов ставят чаще всего, и прослеживают, как это распределение сдвигается от квартала к кварталу.

Третий блок сопоставляет набор ключевых характеристик агентских и человеческих пул-реквестов, значимых для качества программного обеспечения, и отслеживает их временную динамику. Свою работу авторы описывают как эмпирический и лонгитюдный взгляд на роль ИИ-агентов в разработке, который даёт более аккуратное представление о пользе и ограничениях таких инструментов в реальной практике.

Что будет после версии v1

Работа помечена как v1 и загружена 23 июля 2026 года, её подал Iren Mazloomzadeh, разделы Software Engineering и Machine Learning, DOI выдан arXiv через DataCite. Препринт публикуется без рецензирования, и формулировки могут измениться в следующих версиях. Поквартальная динамика в цифрах, перечень типов задач и список сравниваемых характеристик пул-реквестов в аннотацию не вынесены.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.