Сегодня разберём один из самых частых вопросов у тех, кто задумался об изучении анализа данных:
Как мне изучать библиотеки Pandas, Matplotlib и Seaborn?Там же дофига функций и методов 🥲
Как по мне, это правда достаточно неочевидный вопрос, т.к. сами по себе библиотеки довольно объёмные и содержат кучу методов и функций, из-за чего можно подумать, что надо запомнить их все.
Спойлер: это далеко не так, и чтобы быстро их изучить попробуем исходить из практики
Более длительный вариант (для тех, кто любит статьи и курсы):
• Pandas - самая важная библиотека, чтобы работать с табличными данными. Здесь нужно научиться их фильтровать, группировать и производить преобразования таблиц. В связке с ней можно изучить NumPy - разберётесь с массивами и векторными вычислениями, что иногда сильно ускоряет работу с числами. Хороший материал для старта - хендбук от Яндекса по NumPy и Pandas 📋
- Matplotlib - да, кода много и поначалу библиотека кажется громоздкой, но именно она даёт полный контроль над каждым элементом графика и закладывает понимание того, как устроена визуализация в Python в целом. Разобравшись в ней один раз, ты получишь понимание того, как работает визуализация у других библиотек 🎨
- Seaborn - это как раз надстройка над Matplotlib, которая позволяет строить красивые статистические графики буквально в одну строку. После базового Matplotlib обычно сразу ощущается, насколько это удобно. Один из способов изучить — просто листать галерею примеров на официальном сайте и разбирать код 😌
Быстрый вариант (для тех, кто любит практику):
Тут лучшая стратегия - взять реальный датасет и "покрутить" его, попытавшись найти в нём закономерности и инсайты 🔍
Заходим на Kaggle, находим интересный для себя датасет, пытаемся задавать себе вопросы по его структуре (тут можно попросить GPT составить по датасету вопросы) и пытаемся ответить при помощи вышеупомянутых библиотек и их документаций - сначала чистим/агрегируем/фильтруем данные в Pandas, потом визуализируем закономерности 📊
Уверяю, что такая практика на реальных данных в разы эффективнее чтения туториалов без применения навыков, и таким образом можно изучить эти библиотеки за неделю 🔥
Если наберём 100 ❤️, то сделаю авторский jupyter-ноутбук с датасетом и конкретными вопросами к нему. Решив его, ты сможешь поставить галочку в изучении этих библиотек