Всех с праздниками!
Автор в блоге Towards Data Science (VPN) поделилась, как с помощью линейной регрессии построить верные причинно-следственные связи. Статья разбирает применение подхода к анализу результатов как A/B-тестов, так и эмпирических наблюдений. Однако в последнем случае следует трезво воспринимать выводы. Ведь мы никогда не можем быть уверены, что учли все факторы. Статья раскрывает принцип «корреляция еще не причинно-следственная связь», а также объясняет разницу между прогнозной аналитикой и причинно-следственным анализом.
Для определения зависимостей между двумя переменными используется коэффициент Пирсона, который измеряет линейные зависимости, и коэффициенты Спирмена и Кендалла для монотонных зависимостей. Но чаще всего нас интересует, есть ли зависимость вообще. И что делать, если она сложнее приведенных выше? Автор следующей статьи (VPN) рассказал о новом коэффициенте корреляции ξ, предложенном в статье A New Coefficient of Correlation в 2020. Он равен нулю, если переменные независимы, и единице, если одна из них является измеримой функцией другой. Новая корреляция сопровождается асимптотической теорией, которая позволяет проводить проверку гипотез, не делая предположений о базовых распределениях.
На Хабре я нашел добротную статью о ratio-метриках и их линеаризации. Автор объясняет, что такое ratio-метрики в A/B-тестах и как (и зачем) их линеаризовать. Он сравнивает линеаризацию с методами предусредненного среднего, бутстрапом и дельта-методом. Линеаризация позволяет преобразовать ratio-метрики к средней пользовательской метрике. Главные преимущества линеаризованной метрики:
🔹легкость подсчета;
🔹сохранение сонаправленности наблюдаемого эффекта с изменением в целевой ratio-метрике;
🔹корректные p-value;
🔹применимость методов CUPED и стратификации.
#дайджест
Post #160
2.52K

- 🔥 17