Привет! На связи Мария Жарова, ментор курса «ML-инженер» 👋🏻
Представьте ситуацию: вам дают новый датасет и просят «быстро глянуть на данные».
Что обычно вы делаете? Начать можно с
head(), info(), describe() — и за несколько строк кода что-то станет понятно. Но конечно, одного этого недостаточно, чтобы реально оценить качество данных.А что если я скажу, что можно получить полный отчёт по датасету за пару строк кода? В этом поможет
ydata-profiling — библиотека, которая за несколько минут собирает полноценную информацию о датасете и помогает увидеть проблемы ещё до того, как вы начали писать пайплайн или обучать модель.Что именно она показывает:
➖ Общий обзор датасета с автоматическими предупреждениями — дубликаты, сильная корреляция, константные признаки;
➖ Подробную аналитику по каждому столбцу — распределения, выбросы, статистики;
➖ Визуализации для числовых признаков и word cloud для категориальных;
➖ Пропуски и их структуру;
➖ Взаимосвязи между числовыми фичами.
По сути, это быстрый чек-лист качества данных в одном HTML.
❓ Как сгенерировать отчёт на Python
Установите библиотеку, если ранее ей не пользовались:
pip install ydata-profiling
Минимальный код:
import pandas as pd
from ydata_profiling import ProfileReport
df = pd.read_csv("data.csv")
profile = ProfileReport(
df,
title="Первичный анализ датасета"
)
Отчёт можно посмотреть прямо в ноутбуке:
profile.to_notebook_iframe()
Или сохранить в HTML, чтобы поделиться с коллегами:
profile.to_file("data_report.html")Это не просто красивая визуализация — на практике такой отчёт экономит часы: сразу видно, где данные «грязные», какие признаки бесполезны, а какие могут создать проблемы для модели.
Если раньше вы начинали анализ с
head() — попробуйте хотя бы раз начать с profiling.Ставьте ❤️, если было полезно — и сохраняйте, чтобы не потерять!
📊 Simulative