openai

OpenAI отозвала рекомендацию по бенчмарку SWE-Bench Pro

Promtime

openai

OpenAI провела аудит SWE-Bench Pro и оценила, что около 30% задач в наборе сломаны. Ранее компания советовала переходить на этот бенчмарк вместо SWE-bench Verified, теперь рекомендацию отзывает.

Автоматический конвейер пометил 200 задач как проблемные (27,4%), а разбор с участием инженеров нашёл битыми 249 из 731 задачи публичной части (34,1%). Каждую задачу проверяли пять опытных разработчиков.

Ошибки разделили на четыре типа: слишком строгие тесты, недоописанные условия, тесты со слабым покрытием и вводящие в заблуждение формулировки. Больше всего расхождений пришлось на слабое покрытие: люди отметили его в 9,4% бенчмарка против 4,1% у агентного конвейера. На публичной части из 731 задачи топовые модели за восемь месяцев подняли долю решений с 23,3% до 80,3%.

Комментарии

Пока никто не написал. Будьте первым.

Присоединяйтесь к разговору

Войдите через Google, чтобы оставить комментарий. Имя и аватар подставятся из вашего профиля Google, а комментарий появится после модерации.

Из Google мы используем только имя и аватар. Почту не сохраняем.