benchmarks

Ревью от Claude подняло Codex с 71,6% до 89,7%

Promtime

benchmarks

Проверка кода между двумя агентами окупается только в одном направлении. В контролируемом эксперименте на 116 недавних задачах lcb уровней hard и medium Claude в роли рецензента поднял долю успешных решений Codex с 71,6% до 89,7% при p_BH=0,001.

Обратная связка проиграла: Codex, проверявший черновики Claude, снизил результат с 91,4% до 82,8%. Самопроверка Codex дала 84,5%, а самопроверка Claude оставила базовые 91,4% без изменений.

Всего авторы сравнили шесть сценариев, включая одиночную работу каждой модели. Рецензент видел условие задачи и черновик, но не мог запускать тесты. Работа принята на воркшоп Agentic SE в рамках KDD'26, препринт выложен на arXiv 22 июля.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.