Как справляться с «грязными» данными: применение робастной статистики в data science

Стандартные учебники по data science часто далеки от реальности. В реальных проектах мы сталкиваемся с выбросами и неоднородными распределениями, что может сбивать с толку даже опытных аналитиков. Выход из положения — использование робастной статистики, предназначенной для получения надежных результатов, даже когда данные не соответствуют классическим предпосылкам.

В этом материале мы рассмотрим три сценария с использованием Python-библиотеки Pingouin, чтобы справиться с проблемами, возникающими в «грязных» данных. Например, при сравнении уровней алкоголя в белом и красном вине, мы используем тест Манна-Уитни, который не подвержен влиянию выбросов. В другом случае, сравнение различных показателей для одного субъекта можно анализировать с помощью теста Уилкоксона, что позволяет избежать ложных выводов.

Третий сценарий иллюстрирует, как тест Уэлча может помочь сравнить уровень остаточного сахара в вине с различными качественными рейтингами, избегая ошибок, связанных с равенством дисперсий. Эти методы показывают, что успешный data scientist — это тот, кто знает, как действовать, когда данные ставят перед нами трудные задачи.

*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена