Компания OpenAI опубликовала результаты аудита своего бенчмарка SWE-Bench Pro, который предназначен для оценки кодинговых способностей искусственного интеллекта. Выяснилось, что около 30% задач оказались сломанными. Это стало неожиданностью, так как сам бенчмарк был рекомендован OpenAI как улучшенная версия ее предшественника, SWE-bench Verified.
В ходе аудита использовался автоматический фильтр, который определил 286 потенциально проблемных задач из 731. Затем эти задачи проверили люди и ИИ-агенты. Число сломанных задач составило 27,4% по версии машин и 34,1% по версии людей.
Среди основных проблем выделены излишне строгие тесты, недоспецифицированные условия, слабое покрытие и вводящие в заблуждение формулировки. В одном из примеров задача с форматированием Markdown, по умолчанию требующая одного пробела, неожиданно оказалась с двумя пробелами в скрытых тестах.
OpenAI призвала разработчиков создавать новые бенчмарки, которые будут на качественно другом уровне, подчеркивая, что старые подходы уже не работают. Это подчеркивает важность прозрачности и точности в тестировании кодинговых навыков искусственного интеллекта.
*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена
