Привет, любители аналитики! С вами Павел Беляев, ментор курса «Дата-аналитик» и ведущий канала «Тимлидское об аналитике».
SQL это база, но сегодня хочу рассказать кое-что о Python — поразительно мощном инструменте аналитика. А именно — о базовых библиотеках Python, которые должен знать каждый специалист по данным.
1️⃣ Pandas — король обработки данных
Позволяет работать с таблицами как с обычными переменными, а называются они датафреймами. Всё что можно делать с таблицами в SQL, доступно и в Python:
➖ Чтение и запись данных в разных форматах;
➖ Фильтрация, сортировка, группировка;
➖ Объединение датасетов;
➖ Базовые статистические операции.
import pandas as pd
# Пример использования
df = pd.read_csv('data.csv') # записывает в датафрейм данные из файла csv
df.head() # выводит первые строки датафрейма
2️⃣ NumPy — математика для больших данных
➖ Работа с массивами и матрицами;
➖ Математические операции;
➖ Генерация случайных чисел.
import numpy as np
# Пример
array = np.array([1, 2, 3, 4, 5]) # создаёт одномерный массив
mean = np.mean(array) # вычисляет среднее значение массива
3️⃣ Matplotlib и Seaborn — визуализация данных, обычно датафреймов
Позволяют строить графики любого типа: точечные, круговые, гистограммы, ящики с усами и многое другое. Визуализации помогают не только анализировать конечный результат, но и выполнять предобработку и очистку данных.
import matplotlib.pyplot as plt
import seaborn as sns
# Простой график по точкам
plt.plot([1, 2, 3], [4, 5, 6])
plt.show()
4️⃣ Scipy — это уже следующий уровень, основы статистического анализа
from scipy import stats
# Проведение t-теста для независимых выборок
# Сравнивает средние значения двух групп данных
# Помогает определить, есть ли статистически значимые различия между выборками
result = stats.ttest_ind(data1, data2) # data1 и data2 — массивы сравниваемых данных
5️⃣ Statsmodels — ещё более продвинутая статистика
➖ Регрессионный анализ;
➖ Временные ряды;
➖ Эконометрика.
import statsmodels.api as sm
# Простая линейная регрессия
model = sm.OLS(y, x).fit()
Для разработки на Python можно использовать:
🟠 Jupyter Notebook и продвинутая среда JupiterLab, которые поставляются, в частности, с пакетом Anaconda;
🟠 Google Colab — простая, но мощная «модернизация» Jupiter для пользователей Google;
🟠 Visual Studio Code — универсальная среда для профессиональных разработчиков.
А во вторник жду вас на вебинаре «Первичный анализ и очистка данных с помощью Python», где я на примере покажу, как начать работу с данными с помощью Python.
➡️ Зарегистрироваться на вебинар
📊 Simulative