Как справиться с реальными данными: уроки от NoBroker

Работа с данными может быть настоящим испытанием для исследователя. На примере реального проекта компании NoBroker, занимающейся свойственным рынком в Индии, мы рассмотрим основные шаги по подготовке к работе с неаккуратными данными. Проект учит, как создать предсказательную модель, которая определяет взаимодействия с объектами недвижимости, анализируя 28,888 записей, многие из которых содержат пропущенные значения, дубли и ошибки ввода.

Первый урок заключается в том, что пропущенные данные не всегда следует удалять. Например, в колонке photo_urls отсутствует 38% данных. Вместо удаления таких строк, лучше обработать их, рассматривая как нулевые значения.

Кроме того, необходимо обращать внимание на выбросы. Они могут возникать из-за ошибок ввода, как в случае с объектами с 21 ванной и 40,000 квадратных футов. Использование метода IQR для удаления выбросов помогает очистить данные без потери важной информации.

Наконец, плохие форматы данных, такие как некорректные JSON-строки, требуют ремонта. Однако наилучший способ справиться с такими проблемами — это стандартизация данных с самого начала, что позволяет избежать ошибок и задержек в будущем.

Документация и контроль версий также критически важны для поддержки проектной базы, чтобы другие могли легко понимать и исправлять возможные ошибки в будущем. В конечном итоге, работа с грязными данными — это не проблема, а возможность развивать свои аналитические навыки.

*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена