TGViewer
Интеллект в коде: Python, AI, Data Science Интеллект в коде: Python, AI, Data Science @ai_in_progress · 125 subscribers
Post #288 1.19K
Привет 🙂
Предобработка данных часто решает больше, чем любой «крутой» график. Если данные не в порядке, аналитика дает красивые, но бесполезные выводы 📉

Ниже простая последовательность, по которой удобно проходить любой датасет 👇

1️⃣Определяем задачу
Сначала всегда вопрос, а не таблица.
Что хочешь понять из данных, какой показатель посчитать, какое решение принять. От этого зависят нужные столбцы и требования к качеству данных.


2️⃣Быстрый взгляд на данные
Открываем таблицу и смотрим глазами: размер, столбцы, типы значений, первые строки.
Уже тут можно увидеть пропуски, странные записи, непонятные форматы. Это экономит время дальше
👀

3️⃣Приводим форматы в порядок
Числа должны быть числами, даты датами, категории текстом.
Исправляем случаи, где цена хранится как текст, дата как строка, внутри значений лишние символы. Иначе фильтры и расчеты начнут работать некорректно.


4️⃣Удаляем дубликаты
Одинаковые строки завышают выручку, количество событий и пользователей.
Перед анализом убираем полные дубликаты, чтобы не получить «накрученные» метрики
💱

5️⃣Работаем с пропусками
Сначала смотрим, где и сколько пропусков.
Дальше выбираем стратегию: удалить строки, заполнить средним, медианой, отдельной категорией или оставить как отдельный признак. Главное, чтобы решение было осознанным.


6️⃣Чистим лишние символы и написания
Пробелы в начале и конце, разные варианты написания одной категории, лишние знаки в числах и текстах.
Выравниваем значения так, чтобы одинаковые сущности выглядели одинаково. Это сильно упрощает группировки и сводки
✂️

7️⃣Проверяем выбросы и аномалии
Смотрим на слишком большие или маленькие значения, странные даты и суммы.
Решаем, это ошибка ввода или редкий, но реальный случай. Ошибки правим или исключаем, валидные выбросы оставляем, но учитываем их влияние.


8️⃣Финальная проверка
Еще раз смотрим на структуру: типы данных, количество строк, минимум и максимум, долю пропусков.
Важно убедиться, что таблица выглядит логично, критичные проблемы закрыты, а набор данных готов к анализу
📊

Напишите в комментариях, по каким этапам предобработки вы проходите, когда решаете свои задачи с данными. Совпадает ли ваш процесс с этим списком или у вас все устроено иначе 🙂
  • 🔥 5
  • 🐳 2
  • 🫡 2
More from @ai_in_progress
  1. Mar 4, 2026Seedance 2.0 теперь стоит копейки. Официальные цены API вышли сегодня! ByteDance только чт…
  2. Mar 2, 2026🔥ГЛАВНЫЕ НОВОСТИ ИИ ЗА СЕГОДНЯ ➖Grok Imagine взорвал всех Новая фича Расширение от кадра…
  3. Mar 1, 2026Seedance 2.0 - модель, о которой сейчас говорят почти все, кто следит за развитием AI-виде…
  4. Feb 28, 2026Небольшое обновление формата канала📊 Изначально этот канал создавался исключительно для м…
  5. Feb 10, 2026Аналитический пайплайн: двигатель, который превращает данные в решения Вы слышали модное «…
  6. Feb 7, 2026С возвращением в мир данных! 🌐 Ваш канал по аналитике снова в активной фазе. Перерыв окон…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →