Дисперсия - священная корова АБ тестов 🐮
Хочу начать небольшой цикл статей про дисперсию. Сегодня хочу дать интуитивное понимание, что это такое и почему она так важна в контексте АБ тестов.
Начнем с примера. Вот у нас есть интернет магазин где пользователи совершают покупки и мы решили провести АБ тест формы оформления заказа. Вариант А - длинная форма заказа, вариант Б- короткая форма заказа
В итоге собрали выборки пользователей по суммам их заказов
Вариант А: 500, 0, 700, 0, 1000, 0, 1200 - среднее 485,7
Вариант Б: 3000, 800, 200, 0, 500, 0, 0 - среднее 642,85
Если посмотреть просто на выборки, то мы можем сказать, что среднее значение выборки Б больше А. В АБ тесте хотя мы и собираем выборки нас не интересует вопрос среднее какой из выборок больше.
Нас интересует другой вопрос, среднее в генеральной совокупности для какого из вариантов больше? Т.е. нас интересует, вот если бы мы могли взять собрать и замерить покупки всех возможных потенциальных пользователей сайта, то средняя сумма покупки в каком варианте была бы больше?
Но тут встают 2 проблемы
1. Мы не можем собрать всех потенциальных пользователей и оценить по ним метрику.
Т.к. это зачастую просто не реально, мы не можем дотянуться до всех.
2. Полученный набор значений в выборке может плохо отражать реальную ситуацию(среднее) в ГС.
Например, если бы мы провели эксперимент повторно и набирали бы выборки из той же самой ГС, то могли получить какие-то другие значения в выборках
Например
Вариант А: 300, 400, 3000, 0, 100, 600, 500 - среднее 700
Вариант Б: 0, 200, 900, 700, 2000, 0, 0 - среднее 542
Теперь среднее выборки А получилось больше чем Б, хотя мы брали данные из той же генеральной совокупности. Почему выборки взятые из одной и той же ГС могут отличаться?
1 - В силу того что мы случайно отбираем пользователей в группы и вот чисто в силу случая в одну выборку попало больше тех кто заплатил больше.
2 - Дисперсия. Это мера разброса(изменчивости) значений метрики.
Представим, что мы проводим АБ тест и знаем, что если мы покажем вариант А, то все будут покупать на 100, а если вариант Б то на 200.
Вариант А: 100, 100, 100, 100, 100, 100, 100 - среднее 100
Вариант Б: 200, 200, 200, 200, 200, 200, 200 - среднее 200
В данном случае у нас дисперсия будет равна 0. Т.е. нет никакой изменчивости по наблюдениям, они все одинаковы в рамках выборок и ГС.
Если бы мы знали, что у метрики нет никакой изменчивости, т.е. все значения наблюдений будут одинаковыми, то тогда бы нам и АБ тест в принципе был не нужен.
Мы могли бы получить просто по 1 значению в каждый из вариантов и тот в котором это наблюдение будет больше тот вариант и лучше, т.к. мы знаем что все остальные наблюдения и все значения в ГС будут точно такими же.
Но в реальности у нас всегда есть дисперсия, т.е. изменчивость значений и чем больше значения отличаются между собой внутри выборок, тем сложнее нам на глаз определить, а есть ли разница между выборками и экстраполировать этот вывод на ГС.
Post #975
2.93K
- 🔥 30
- 👍 11
- ❤ 3
- ❤🔥 2