TGViewer
Интеллект в коде: Python, AI, Data Science Интеллект в коде: Python, AI, Data Science @ai_in_progress · 125 subscribers
Post #50 48
Подсчет простых статистик в Pandas

Pandas предоставляет удобный набор методов для быстрого получения базовой статистики по данным. С их помощью можно узнать количество наблюдений, среднее значение, медиану, стандартное отклонение, минимальные и максимальные значения, а также квантили. Это помогает сразу оценить «состояние» данных.

1. Основные методы
a) Метод describe() – это универсальный инструмент для получения сводной статистики по числовым столбцам DataFrame. Он рассчитывает следующие показатели:

- count – количество ненулевых значений,
- mean – среднее значение,
- std – стандартное отклонение,
- min – минимальное значение,
- 25%, 50% (медиана) и 75% – квантили,
- max – максимальное значение.


Пример использования:
import pandas as pd

# Создадим DataFrame с данными
data = {
'Продажи': [200, 450, 300, 500, 400, None],
'Прибыль': [20, 45, 30, 50, 40, 35],
'Расходы': [180, 405, 270, 450, 360, 325]
}
df = pd.DataFrame(data)

# Получаем сводную статистику по числовым столбцам
stats = df.describe()
print(stats)


Вывод может выглядеть так:
           Продажи   Прибыль     Расходы
count 5.000000 6.000000 6.000000
mean 370.000000 38.333333 344.166667
std 127.279220 9.635332 62.030168
min 200.000000 20.000000 180.000000
25% 300.000000 31.250000 292.500000
50% 400.000000 37.500000 360.000000
75% 450.000000 43.750000 397.500000
max 500.000000 50.000000 450.000000


b) Методы mean(), median(), std(), min(), max()
Иногда нужно получить отдельные статистики. Для этого можно использовать следующие методы:

- df.mean() – вычисляет среднее по каждому столбцу.
- df.median() – вычисляет медиану.
- df.std() – считает стандартное отклонение.
- df.min() и df.max() – находят минимальные и максимальные значения соответственно.

Пример:
print("Среднее значение продаж:", df['Продажи'].mean())
print("Медиана прибыли:", df['Прибыль'].median())
print("Стандартное отклонение расходов:", df['Расходы'].std())
print("Минимальные продажи:", df['Продажи'].min())
print("Максимальная прибыль:", df['Прибыль'].max())


c) Квантили с помощью quantile()
Если нужно узнать конкретные процентные значения (например, 25-й или 75-й процентиль), используется метод quantile(). Пример:
q25 = df['Прибыль'].quantile(0.25)
q75 = df['Прибыль'].quantile(0.75)
print("25-й процентиль прибыли:", q25)
print("75-й процентиль прибыли:", q75)


2. Примеры с пояснениями
Рассмотрим практический пример с данными о продажах:
import pandas as pd
import numpy as np

# Сгенерируем DataFrame с данными о продажах
np.random.seed(42)
df_sales = pd.DataFrame({
'Продажи': np.random.randint(100, 1000, size=10),
'Прибыль': np.random.randint(10, 100, size=10)
})

# Выводим DataFrame
print("Данные о продажах:")
print(df_sales)

# Получаем сводную статистику для столбцов
print("\nСводная статистика (describe):")
print(df_sales.describe())

# Отдельный расчет статистик
mean_sales = df_sales['Продажи'].mean()
median_profit = df_sales['Прибыль'].median()
std_profit = df_sales['Прибыль'].std()
min_sales = df_sales['Продажи'].min()
max_profit = df_sales['Прибыль'].max()

print("\nРассчитанные статистики:")
print(f"Средние продажи: {mean_sales:.2f}")
print(f"Медиана прибыли: {median_profit:.2f}")
print(f"Стандартное отклонение прибыли: {std_profit:.2f}")
print(f"Минимальные продажи: {min_sales}")
print(f"Максимальная прибыль: {max_profit}")

В результате вы увидите сначала исходные данные, затем таблицу со сводной статистикой и, наконец, отдельные рассчитанные показатели.

3. Заключение
Подсчет простых статистик в Pandas – это мощный и быстрый способ получить представление о наборе данных. Используя методы describe(), mean(), median(), std(), min(), max() и quantile(), можно за несколько строк кода вычислить основные показатели, необходимые для первичного анализа данных. Эти инструменты особенно полезны при исследовании новых данных, когда нужно быстро выявить особенности и возможные аномалии.

#Pandas #DataScience #Python #АнализДанных
  • 👍 3
  • 🔥 2
  • ❤ 1
More from @ai_in_progress
  1. Mar 4, 2026Seedance 2.0 теперь стоит копейки. Официальные цены API вышли сегодня! ByteDance только чт…
  2. Mar 2, 2026🔥ГЛАВНЫЕ НОВОСТИ ИИ ЗА СЕГОДНЯ ➖Grok Imagine взорвал всех Новая фича Расширение от кадра…
  3. Mar 1, 2026Seedance 2.0 - модель, о которой сейчас говорят почти все, кто следит за развитием AI-виде…
  4. Feb 28, 2026Небольшое обновление формата канала📊 Изначально этот канал создавался исключительно для м…
  5. Feb 10, 2026Аналитический пайплайн: двигатель, который превращает данные в решения Вы слышали модное «…
  6. Feb 7, 2026С возвращением в мир данных! 🌐 Ваш канал по аналитике снова в активной фазе. Перерыв окон…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →