TGViewer
rafanalytics rafanalytics @rafalytics · 5.66K subscribers
Post #208 6.62K
Библиотеки для анализа данных: с чего начать? 🐍

Сегодня разберём один из самых частых вопросов у тех, кто задумался об изучении анализа данных:
Как мне изучать библиотеки Pandas, Matplotlib и Seaborn?
Там же дофига функций и методов 🥲

Как по мне, это правда достаточно неочевидный вопрос, т.к. сами по себе библиотеки довольно объёмные и содержат кучу методов и функций, из-за чего можно подумать, что надо запомнить их все.
Спойлер: это далеко не так, и чтобы быстро их изучить попробуем исходить из практики

Более длительный вариант (для тех, кто любит статьи и курсы):

• Pandas - самая важная библиотека, чтобы работать с табличными данными. Здесь нужно научиться их фильтровать, группировать и производить преобразования таблиц. В связке с ней можно изучить NumPy - разберётесь с массивами и векторными вычислениями, что иногда сильно ускоряет работу с числами. Хороший материал для старта - хендбук от Яндекса по NumPy и Pandas 📋

- Matplotlib - да, кода много и поначалу библиотека кажется громоздкой, но именно она даёт полный контроль над каждым элементом графика и закладывает понимание того, как устроена визуализация в Python в целом. Разобравшись в ней один раз, ты получишь понимание того, как работает визуализация у других библиотек 🎨

- Seaborn - это как раз надстройка над Matplotlib, которая позволяет строить красивые статистические графики буквально в одну строку. После базового Matplotlib обычно сразу ощущается, насколько это удобно. Один из способов изучить — просто листать галерею примеров на официальном сайте и разбирать код 😌

Быстрый вариант (для тех, кто любит практику):

Тут лучшая стратегия - взять реальный датасет и "покрутить" его, попытавшись найти в нём закономерности и инсайты 🔍
Заходим на Kaggle, находим интересный для себя датасет, пытаемся задавать себе вопросы по его структуре (тут можно попросить GPT составить по датасету вопросы) и пытаемся ответить при помощи вышеупомянутых библиотек и их документаций - сначала чистим/агрегируем/фильтруем данные в Pandas, потом визуализируем закономерности 📊
Уверяю, что такая практика на реальных данных в разы эффективнее чтения туториалов без применения навыков, и таким образом можно изучить эти библиотеки за неделю 🔥

Если наберём 100 ❤️, то сделаю авторский jupyter-ноутбук с датасетом и конкретными вопросами к нему. Решив его, ты сможешь поставить галочку в изучении этих библиотек
  • ❤ 152
  • ❤‍🔥 16
  • 💘 11
  • 👍 1
  • 🐳 1
  • 🌭 1
More from @rafalytics
  1. Oct 1, 2026Галя, у нас нейросеть 🤖 Когда-то я писал, как взял наггетсы в SPARе и удивился, что касса…
  2. Sep 1, 2026Вдохновляющая статистика из тенниса 🎾 Есть вот такая статья про статистику Роджера Федере…
  3. Jul 14, 2026Как эффективнее попросить рефералку? 🤝 Мне часто пишут ребята из канала с просьбой пореко…
  4. Jul 7, 2026Анализируем водопой на ЧМ-2026 💧⚽️ Приятно, когда можно объединить аналитику с увлечениям…
  5. Jun 16, 2026Считаем крошки на рынке фастфуда Вчера я впервые попробовал "Крошку-Картошку") 🥔 Странно,…
  6. May 27, 2026Личный блог — это плюс в карьере или red flag для нанимающих? 🚩 Я начал вести этот канал…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →