Проверка кода между двумя агентами окупается только в одном направлении. В контролируемом эксперименте на 116 недавних задачах lcb уровней hard и medium Claude в роли рецензента поднял долю успешных решений Codex с 71,6% до 89,7% при p_BH=0,001.
Обратная связка проиграла: Codex, проверявший черновики Claude, снизил результат с 91,4% до 82,8%. Самопроверка Codex дала 84,5%, а самопроверка Claude оставила базовые 91,4% без изменений.
Всего авторы сравнили шесть сценариев, включая одиночную работу каждой модели. Рецензент видел условие задачи и черновик, но не мог запускать тесты. Работа принята на воркшоп Agentic SE в рамках KDD'26, препринт выложен на arXiv 22 июля.

