Корреляция
Во время выступления на датафесте я продемонстрировал слайд с определенной воронкой отбора признаков. Один из вариантов отбора был связан с корреляцией. Очевидно, что она помогает понять взаимосвязи между различными переменными (или таргетом), но действительно ли это то самое толкование существующих связей? Давайте попробуем ответить на этот вопрос.
Что такое корреляция?
Корреляция — это статистическая мера, показывающая степень и направление взаимосвязи между двумя переменными. Если число сожжённого бензина растёт с числом пройденного расстояния, то вероятней всего эти наблюдения скоррелированы и имеют положительный знак связи.
Если же две переменные изменяются в противоположных направлениях - растут и падают, падают и растут - то вероятней всего у них отрицательная корреляция (с ростом пройденного расстояния идёт снижение количества бензина в баке)
Есть ещё отсутствие корреляции, или ее близость к 0 - здесь при изменении одного признака скорее всего не меняется другой. Масса автомобиля (без учёта бензина) не меняется с пройденным расстоянием.
Какую корреляцию мы можем рассматривать?
1. Коэффициент Пирсона (Pearson)
- Используется для измерения линейной корреляции между двумя количественными переменными.
Очень подходит в те моменты, когда мы уверены в линейной зависимости признаков или хотим ее проверить (например для регрессии)
2. Коэффициент Спирмена (Spearman)
- Применяется для измерения степени монотонной (нелинейной!) взаимосвязи между двумя переменными.
Хорошо подходит для того, чтобы найти те переменные, над которыми можно сделать преобразования для их линеаризации
В принципе этих 2 пунктов хватает для покрытия большого числа кейсов (например, про связь регрессии и корреляции Пирсона тут, немножко подробно про корреляцию Спирмана тут), но нам с вами как обычно этого недостаточно.
3. Коэффициент phi_k (Phik)
- Применяется для нахождения схожести распределений двух рассматриваемых переменных во встречаемых наблюдениях.
Подходит для тех случаев, когда обычная монотонная корреляция может не обнаружить связь (допустим, с зависимостью типа y=x^2)
Оригинальная статья тут, есть даже неплохой разбор. И есть небольшой ноутбук с пояснениями.
4. Коэффициент ранговой корреляции
- Также удобно применять для поиска тех немонотонных зависимостей, которые можо обнаружить при помощи плавности изменения ранга одной переменной относительно другой.
Область применимости примерно как в пункте 3.
Неплохо расписано тут. Прям супер подробной дополнительной иниформации еще не нашел, буду рад если покидаете еще источников.
Надеюсь данные методы помогут вам находить более сложные зависимости в данных.
Ну и конечно не стоит забывать о том, что correlation does not imply causation!
#statistics
Post #333
453
- 👍 6
- ❤ 4
- 🔥 3