Привет 🙂
Предобработка данных часто решает больше, чем любой «крутой» график. Если данные не в порядке, аналитика дает красивые, но бесполезные выводы 📉
Ниже простая последовательность, по которой удобно проходить любой датасет 👇
1️⃣Определяем задачу
Сначала всегда вопрос, а не таблица.
Что хочешь понять из данных, какой показатель посчитать, какое решение принять. От этого зависят нужные столбцы и требования к качеству данных.
2️⃣Быстрый взгляд на данные
Открываем таблицу и смотрим глазами: размер, столбцы, типы значений, первые строки.
Уже тут можно увидеть пропуски, странные записи, непонятные форматы. Это экономит время дальше 👀
3️⃣Приводим форматы в порядок
Числа должны быть числами, даты датами, категории текстом.
Исправляем случаи, где цена хранится как текст, дата как строка, внутри значений лишние символы. Иначе фильтры и расчеты начнут работать некорректно.
4️⃣Удаляем дубликаты
Одинаковые строки завышают выручку, количество событий и пользователей.
Перед анализом убираем полные дубликаты, чтобы не получить «накрученные» метрики 💱
5️⃣Работаем с пропусками
Сначала смотрим, где и сколько пропусков.
Дальше выбираем стратегию: удалить строки, заполнить средним, медианой, отдельной категорией или оставить как отдельный признак. Главное, чтобы решение было осознанным.
6️⃣Чистим лишние символы и написания
Пробелы в начале и конце, разные варианты написания одной категории, лишние знаки в числах и текстах.
Выравниваем значения так, чтобы одинаковые сущности выглядели одинаково. Это сильно упрощает группировки и сводки ✂️
7️⃣Проверяем выбросы и аномалии
Смотрим на слишком большие или маленькие значения, странные даты и суммы.
Решаем, это ошибка ввода или редкий, но реальный случай. Ошибки правим или исключаем, валидные выбросы оставляем, но учитываем их влияние.
8️⃣Финальная проверка
Еще раз смотрим на структуру: типы данных, количество строк, минимум и максимум, долю пропусков.
Важно убедиться, что таблица выглядит логично, критичные проблемы закрыты, а набор данных готов к анализу 📊
Напишите в комментариях, по каким этапам предобработки вы проходите, когда решаете свои задачи с данными. Совпадает ли ваш процесс с этим списком или у вас все устроено иначе 🙂
Post #57
1.04K
