Представьте, что вам дали некоторый датасет и попросили его проанализировать/обучить модель на этих данных. Что бы вы сделали в самую первую очередь? Большинство ответят прочитали бы и вывели head😁
В целом, это верный ответ, здесь же можно добавить info() и describe().
Но есть кое-что получше: библиотека ydata-profiling для первичного анализа данных и проверки их качества.
С помощью неё можно автоматически получить подробный
За несколько минут можно создать отчёт, включающий:
⛵️ общий анализ датасета с разделом предупреждений, на которые стоит обратить внимание в первую очередь
⛵️ детальный отчёт по каждой переменной, включая наглядное представление дубликатов, выбросов и статистических характеристик
⛵️ распределения для числовых признаков и "облако слов" для категориальных
⛵️ взаимные зависимости числовых признаков
⛵️ наличие пропусков
⛵️ и, конечно, аналог head и tail
Создать отчёт очень просто!
1. Для начала установите библиотеку:
pip install ydata-profiling
2. Далее загрузите ваш датафрейм и сгенерируйте отчет, это займёт всего несколько минут:
import pandas as pd
from ydata_profiling import ProfileReport
# Загружаем данные
data = pd.read_csv("data.csv")
# Генерируем отчёт
profile = ProfileReport(data, title="Мой_первый_отчёт")
3. Готовый отчёт можно вывести и посмотреть прямо в ноутубке или сохранить в html:
profile.to_notebook_iframe()
# Или сохраняем отчет вx HTML файл
profile.to_file("Мой_первый_отчёт.html")
На всякий случай, официальная документация тут.
В видео трейлер с демонстрацией основных возможностей библиотеки💫
Удачной недели!🙂
#аналитика@data_easy
#classic_ml@data_easy
#python@data_easy