OpenAI провела аудит SWE-Bench Pro и оценила, что около 30% задач в наборе сломаны. Ранее компания советовала переходить на этот бенчмарк вместо SWE-bench Verified, теперь рекомендацию отзывает.
Автоматический конвейер пометил 200 задач как проблемные (27,4%), а разбор с участием инженеров нашёл битыми 249 из 731 задачи публичной части (34,1%). Каждую задачу проверяли пять опытных разработчиков.
Ошибки разделили на четыре типа: слишком строгие тесты, недоописанные условия, тесты со слабым покрытием и вводящие в заблуждение формулировки. Больше всего расхождений пришлось на слабое покрытие: люди отметили его в 9,4% бенчмарка против 4,1% у агентного конвейера. На публичной части из 731 задачи топовые модели за восемь месяцев подняли долю решений с 23,3% до 80,3%.

