Перейти к содержанию

benchmarks

Copilot первый в тесте GitHub и четвёртый у Martian

Promtime

Новый бенчмарк для ИИ-ревью кода возглавил продукт той самой компании, которая этот бенчмарк и придумала: Copilot code review занял первое место в ReviewBench от GitHub с результатом 40,1% по grounded F1. Как пишет The New Stack, в независимом онлайн-рейтинге Martian тот же Copilot стоит только четвёртым.

Коротко

  • GitHub вместе с Microsoft опубликовал открытый ReviewBench: 219 публичных пулл-реквестов из 187 репозиториев на 19 языках, на которых разные ИИ-ревьюеры разбирают одни и те же изменения.
  • Copilot code review в режиме Balanced набрал 40,1% grounded F1, а у Martian в онлайн-рейтинге на 6 октября лидирует Cubic с 64,9% F1, Copilot там четвёртый с 60,9%.
  • Первую таблицу ReviewBench заполнила сама команда GitHub на публичных версиях продуктов, вендоры эти прогоны не проводили и не проверяли, а Copilot тестировали 1 октября, Cubic и Greptile ещё в июне.

Если вы не следили: GitHub показал Copilot code review в октябре 2024 года, а в апреле следующего года открыл его всем платным подписчикам Copilot. С тех пор ревьюер перевели на агентную архитектуру, которая подтягивает более широкий контекст из репозитория, начали списывать за него минуты GitHub Actions в приватных репозиториях и разрешили ему одобрять пулл-реквесты. 28 сентября режимом по умолчанию стал более тщательный Balanced.

ReviewBench собран из 219 пулл-реквестов, отобранных среди 103,9 миллиона

Конкурентов у Copilot в ревью хватает: такие проверки предлагают Qodo, Greptile, Cubic, Devin и Cursor, а CodeRabbit заметно представлен в других рейтингах ревью кода. ReviewBench GitHub разработал вместе с Microsoft и представил в понедельник как общую мерку для всех этих систем.

Чтобы собрать корпус, в GitHub проанализировали 103,9 миллиона пулл-реквестов. По распределению языков и размеров репозиториев выборка близка к GitHub в целом, а вот крошечные однофайловые правки в ней намеренно отодвинуты на второй план. Авторы методики, Алехандро Кардерера де Диего из GitHub и Мишель Чжоу из Microsoft, объясняют, зачем понадобился ещё один тест:

Existing benchmarks often make tradeoffs between label quality, coverage, and how well they represent real-world code review, leaving a gap for a rigorous and reproducible evaluation methodology that brings these pieces together.

Таблицу заполнила команда GitHub, и Copilot прогнали 1 октября, а Cubic и Greptile в июне

Первые записи в рейтинге сделала сама команда GitHub: она запускала публично доступные версии каждого продукта, а вендоры эти тесты не проводили и не проверяли. Даты прогонов разные, поэтому часть результатов заметно старше остальных. ReviewBench сам предупреждает, что продукты с тех пор могли измениться и что успех на этом корпусе не обязательно повторится на коде конкретной компании.

При этом GitHub публикует датасет, методику и настройки судейства, а вендоры могут через самообслуживание отправлять собственные прогоны, которые добавляются в таблицу по мере оценки. Кардерера де Диего в LinkedIn привёл и внутренний аргумент в пользу бенчмарка:

We've been using ReviewBench to improve GitHub Copilot Code Review, and its offline results have consistently anticipated the direction of later production experiments.

У Martian Copilot четвёртый в онлайн-рейтинге и пятый в офлайн

Исследовательская компания Martian запустила свой Code Review Bench в феврале. Он совмещает офлайн-тест с онлайн-трекером, который смотрит, как разработчики реагируют на комментарии ревьюеров в настоящих open source репозиториях. На запуске Martian сообщила, что офлайн-результаты расходились с реальным использованием, и сделала главной метрикой онлайн-версию.

В онлайн-рейтинге на 6 октября первым идёт Cubic с 64,9% F1, за ним Greptile и CodeRabbit, Copilot четвёртый с 60,9%. В офлайн-таблице лидирует Qodo Deep, следом Cubic и Augment, а Copilot пятый с 58% по F2. Метрика F2 даёт полноте больший вес, чем точности, то есть сильнее награждает за долю пойманных проблем.

Напрямую с ReviewBench эти цифры не сравнить: данные и методика подсчёта у тестов разные. Независимость Martian сделала частью своей позиции, назвав себя хорошо финансируемой лабораторией, которая не обучает модели, не продаёт инструменты для кода и не заинтересована в победе какого-либо из них. Бенчмарк и методика открыты под лицензией MIT.

В июле свой ReviewBench на 59 задачах уже выпускал LangChain

Путаницы добавляет совпадение имён. Ещё в июле LangChain опубликовал собственный бенчмарк для ИИ-ревью кода с тем же названием ReviewBench. Он меньше и устроен иначе: 59 задач взяты из кодовой базы LangSmith, а публичной таблицы с коммерческими продуктами у него нет.

LangChain прогонял разные модели через одну и ту же агентную обвязку Deep Agents. Получается, что этот тест сравнивает модели при общей конфигурации агента и не ранжирует готовые сервисы ревью, как делают GitHub и Martian.

Эталонные находки размечает Claude Sonnet 5, а 47 из них люди поправили вручную

Самое трудное в таком тесте определить правильный ответ. ReviewBench собирает эталонный набор находок из нескольких источников: комментариев живых ревьюеров, правок, которые авторы позже внесли в код, срабатываний статических анализаторов и замечаний LLM-ревьюеров. Находки классифицирует Claude Sonnet 5, а отдельная модель-сопоставитель решает, описывает ли замечание участника ту же проблему, что и запись в эталоне.

Представьте экзамен, где ключ ответов составили несколько проверяющих, а работу ученика сверяет с ключом ассистент, который смотрит на смысл, а не на совпадение слов. Людей тоже подключили: 47 находок, сначала признанных верными срабатываниями, исправили вручную, а суждения людей и классификатора о том, верна находка или ложна, совпали в 96,6% случаев.

Итоговая grounded F1 сводит в одно число точность, то есть долю замечаний ревьюера, совпавших с известными находками, и полноту, то есть долю известных проблем, которые он нашёл.

Главная оговорка видна в самой таблице: бенчмарк вендора, где первым стоит продукт вендора, а прогоны конкурентов сделаны тем же вендором и без их проверки. На наш взгляд, разница в датах весит здесь не меньше авторства: Copilot тестировали 1 октября, через три дня после того, как Balanced стал режимом по умолчанию, а Cubic и Greptile оцениваются по июньским версиям. Сравнение у Martian, судя по всему, показывает, насколько итоговый победитель зависит от устройства теста.

Придут ли вендоры со своими прогонами

Таблица ReviewBench пока остаётся снимком, сделанным силами GitHub. Самообслуживание для вендоров уже открыто, но выбирать конфигурации для отправки они будут сами. Сколько из них воспользуется этой возможностью и когда в таблице появятся свежие результаты Cubic и Greptile, пока неизвестно. От этого зависит, станет ли рейтинг действительно общим или так и останется внутренним инструментом GitHub с публичной витриной.

Читайте также

  1. GLM 5.3 подписал коммит именем Claude Fable 5
  2. Codex после сжатия вспомнил 68 ответов из 178
  3. Jev дешевле Claude Fable в 274 раза, но точность 98%
  4. Агентам дали писать базу Perplexity, но не запускать её
  5. Обвязка агента меняет расход токенов
  6. 73% на OSWorld 2.0 и две трети цены конкурентов

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.