Ученые MIT обнаружили, что популярные платформы ранжирования больших языковых моделей (LLM) могут быть подвержены искажениям из-за нескольких взаимодействий пользователей. Эти платформы помогают компаниям выбирать лучшие модели для задач, таких как резюмирование отчетов о продажах или обработка клиентских запросов.
Исследование показало, что малое количество пользовательских отзывов может существенно повлиять на результаты рейтинга, что может ввести пользователей в заблуждение. Существующий метод оценки таких платформ научно обоснован, позволяя выявить «проблемные» данные, вызывающие искажения.
Один из авторов исследования, профессор Тамара Бродерик, подчеркивает важность осознания того, что высокий ранг модели может зависеть от всего нескольких отзывов, что вызывает опасения относительно надежности решений, основанных на этих рейтингах. Специалисты советуют собирать более детальные отзывы для улучшения качества оценок моделей.
Исследование, проходящее в рамках конференции по обучению представлениям, открывает новые горизонты для улучшения оценки и использования LLM в бизнесе.
*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена
