Статья о байесовском подходе. Она поверхностная и будет неинтересна людям, глубоко погруженным в статистику. Глобально в мире статистики есть 2 подхода: частотный и байесовский.
Частотный подход
Подход возник в 20 веке. Главные имена - Госсет (автор критерия Стьюдента), Пирсон и Фишер.
В целом идея такая: допустим, у вас есть какая-то выборка (размеры ног случайно отобранных жителей Земли 38, 42.5, 36, 40 и т.д.).
И у вас есть какие-то параметры.
Пример: вы знаете, что размеры ног нормально распределены. Нормальное распределение - это такой “колокол”. С точки зрения математики этот “колокол” обладает разными интересными свойствами, но мы не будем углубляться в это.
Подходы типа t-test (критерий Стьюдента), z-score, бутстрапа и дальше из всего набора отвечают на вопрос: “Насколько данная выборка соответствует параметрам?”.
Пример: “Насколько вот этот набор размеров ног похож на нормальное распределение?”. Зная параметры распределения и имея на руках данные, вы делаете статистические выводы.
Байесовский подход
Байес жил в 18 веке, т.е. за 200 лет до Фишера. Он сформулировал теорему, которая позволяет вычислить вероятность события при условии другого события.
Пример: у вас есть вероятность “быть блондином при условии, что глаза у вас голубые”. Найти вероятность “голубоглазости при условии, что блондин”.
На первый взгляд, не очень понятно, как это применять. Но современные статистики придумали такую формулировку: “найти вероятность таких данных при условии, что их параметры (смотри выше) вот такие”. На выходе байесовский подход отдает параметры распределения.
Обратите внимание на разницу между подходами:
В частотном подходе параметры распределения заданы. В байесовском они вычисляются.
В чем отличие для нас как пользователей подходов?
Частотный метод
Работая с частотным методом (например критерий Стьюдента) и, подавая ему на вход 2 гипотезы, вы получаете ответ на вопрос: “Какова вероятность увидеть эти данные при условии верности нулевой гипотезы?”. Гипотеза принимается, если вероятность “нулевой гипотезы” (ничего не произошло) <5% (или как говорят p-value <0.05).
Пример: у вас есть синяя кнопка и есть гипотеза “зеленая кнопка улучшает конверсию”. Вы проводите АВ-эксперимент, меняете цвет кнопки, смотрите в данные и задаете себе вопрос выше. Данные такие же как и при синей.
Вывод: мы не можем откинуть нулевую гипотезу. На этом все. Стоит ли вам перекрашивать кнопку в зеленый цвет? Частотный подход не дает ответа.
Байесовский метод
Байесовский метод в примере с кнопкой работает по-другому. Если ему на вход дать те же самые данные, он скажет: “Вероятность, что синяя кнопка лучше - 50%. Вероятность, что зеленая кнопка лучше - тоже 50%”. Короче, “хочешь перекрашивай, хочешь - не перекрашивай”.
Применимость
Для науки
вы используете частотный подход. Если вы утверждаете, что земля квадратная, то вы должны собрать достаточно данных, чтобы отрицать нулевую гипотезу о круглости земли.
Пример: Вы находитесь в своей квартире. У вас есть гипотеза: “земля квадратная”. В частотном подходе вы откидываете эту гипотезу, т. к. все ваши данные не противоречат идее о том, что “земля круглая”.
В бизнесе
вы вполне можете использовать Байеса. В примере с квартирой: “Мы сейчас находимся в квартире и вполне можем считать, что Земля квадратная. Ничего от этого в нашей жизни не изменится”.
Байесовский подход выдает: “Вероятность лучшести этой гипотезы 62%” и мы можем принимать гипотезы, которые не подтверждаются частотным подходом.
Почти все современные платформы АВ-тестирования используют байесовский метод из-за большей наглядности выводов для бизнеса. Интересно, что мир отказывается от подходов 20 века и начинает использовать методы, которые были придуманы еще в 18 веке.
Post #39
896