TGViewer
asisakov asisakov @asisakov_channel · 4.08K subscribers
Post #333 453
Корреляция

Во время выступления на датафесте я продемонстрировал слайд с определенной воронкой отбора признаков. Один из вариантов отбора был связан с корреляцией. Очевидно, что она помогает понять взаимосвязи между различными переменными (или таргетом), но действительно ли это то самое толкование существующих связей? Давайте попробуем ответить на этот вопрос.

Что такое корреляция?

Корреляция — это статистическая мера, показывающая степень и направление взаимосвязи между двумя переменными. Если число сожжённого бензина растёт с числом пройденного расстояния, то вероятней всего эти наблюдения скоррелированы и имеют положительный знак связи.

Если же две переменные изменяются в противоположных направлениях - растут и падают, падают и растут - то вероятней всего у них отрицательная корреляция (с ростом пройденного расстояния идёт снижение количества бензина в баке)

Есть ещё отсутствие корреляции, или ее близость к 0 - здесь при изменении одного признака скорее всего не меняется другой. Масса автомобиля (без учёта бензина) не меняется с пройденным расстоянием.

Какую корреляцию мы можем рассматривать?

1. Коэффициент Пирсона (Pearson)
- Используется для измерения линейной корреляции между двумя количественными переменными.
Очень подходит в те моменты, когда мы уверены в линейной зависимости признаков или хотим ее проверить (например для регрессии)

2. Коэффициент Спирмена (Spearman)
- Применяется для измерения степени монотонной (нелинейной!) взаимосвязи между двумя переменными.
Хорошо подходит для того, чтобы найти те переменные, над которыми можно сделать преобразования для их линеаризации

В принципе этих 2 пунктов хватает для покрытия большого числа кейсов (например, про связь регрессии и корреляции Пирсона тут, немножко подробно про корреляцию Спирмана тут), но нам с вами как обычно этого недостаточно.

3. Коэффициент phi_k (Phik)
- Применяется для нахождения схожести распределений двух рассматриваемых переменных во встречаемых наблюдениях.
Подходит для тех случаев, когда обычная монотонная корреляция может не обнаружить связь (допустим, с зависимостью типа y=x^2)
Оригинальная статья тут, есть даже неплохой разбор. И есть небольшой ноутбук с пояснениями.

4. Коэффициент ранговой корреляции
- Также удобно применять для поиска тех немонотонных зависимостей, которые можо обнаружить при помощи плавности изменения ранга одной переменной относительно другой.
Область применимости примерно как в пункте 3.
Неплохо расписано тут. Прям супер подробной дополнительной иниформации еще не нашел, буду рад если покидаете еще источников.

Надеюсь данные методы помогут вам находить более сложные зависимости в данных.
Ну и конечно не стоит забывать о том, что correlation does not imply causation!

#statistics
  • 👍 6
  • ❤ 4
  • 🔥 3
More from @asisakov_channel
  1. Sep 24, 2026Post #1428
  2. Sep 24, 2026Оказывается недавно вышел Opus 5.5, который типа догоняет Fable 5.1, и при этом дешевле на…
  3. Sep 23, 2026Таки вы не Исаков, а Исааков 😏 Шекели жалко
  4. Sep 23, 2026Недавно во второй раз забанили в Клоде, было очень обидно за свою $20 подписку 😭 P.S. При…
  5. Sep 23, 2026Post #1424
  6. Sep 22, 2026Дайте мне повод сжечь токены, и я сделаю это! #meme
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →