Исследователи прогнали Claude и Codex по 116 недавним задачам уровня hard и medium из набора lcb в шести сценариях: сольные прогоны обеих моделей, два перекрёстных порядка проверки и две самопроверки. Ревьюер видел условие задачи и черновик решения, но не мог запускать тесты, что приближает сценарий к обычному код-ревью.
Ревью от Claude подняло долю прошедших черновиков Codex с 71,6% до 89,7% (p = 0,001). Самопроверка Codex дала 84,5% (p = 0,022).
Обратное направление не окупилось. Codex на черновиках Claude опустил долю с 91,4% до 82,8% (p = 0,046), а самопроверка Claude оставила базовые 91,4% без изменений.
Препринт arXiv:2607.21656 выложен 22 июля 2026 года, работа принята на воркшоп Agentic SE в рамках KDD'26.

