TGViewer
Библиотека собеса по Data Science | вопросы с собеседований Библиотека собеса по Data Science | вопросы с собеседований @ds_interview_lib · 4.46K subscribers
Post #980 863
🚫 Что делать с пропущенными значениями перед нормализацией или стандартизацией признаков

Пропущенные значения (NaN, пустые ячейки) затрудняют масштабирование данных, потому что статистики вроде среднего, стандартного отклонения или минимума становятся некорректными. Поэтому пропуски нужно обработать до нормализации.

✅ Основные варианты

1️⃣ Импутация (восстановление) пропущенных значений

— Простые методы: среднее, медиана, мода.
— Продвинутые: KNN, модели на деревьях, многократная импутация (Multiple Imputation).

2️⃣ Удаление строк с пропусками

— Допустимо, если доля пропущенных значений очень мала.

3️⃣ Использование моделей, устойчивых к пропускам

— Некоторые алгоритмы (например, XGBoost, CatBoost) умеют обрабатывать пропуски без предварительной импутации.

📌 Вывод

— Пропуски надо обрабатывать до масштабирования.
— Лучший подход — импутация на обучении, затем масштабирование по тем же правилам.
— Не смешивайте статистики между train и test — это критично для честной оценки модели.

Библиотека собеса по Data Science
  • ❤ 3
More from @ds_interview_lib
  1. Sep 15, 2026💬 Как инициализировать параметры в логистической регрессии, и важно ли это Частый вариант…
  2. Sep 15, 2026😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как трати…
  3. Aug 5, 2026❓ Могут ли в Adam возникать проблемы исчезающих или взрывающихся градиентов Да, полностью…
  4. Aug 5, 2026👅 Самое сложное — выбрать не курс, а направление Сегодня хочется разобраться в AI-агентах…
  5. Aug 5, 2026Один доступ вместо вечного выбора между «нужно для работы» и «давно хотелось изучить» 👇
  6. Jul 31, 2026Post #1596
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →