TGViewer
Борзило Борзило @y_borzilo · 5.6K subscribers
Post #975 2.93K
Дисперсия - священная корова АБ тестов 🐮
Хочу начать небольшой цикл статей про дисперсию. Сегодня хочу дать интуитивное понимание, что это такое и почему она так важна в контексте АБ тестов.

Начнем с примера. Вот у нас есть интернет магазин где пользователи совершают покупки и мы решили провести АБ тест формы оформления заказа. Вариант А - длинная форма заказа, вариант Б- короткая форма заказа

В итоге собрали выборки пользователей по суммам их заказов

Вариант А: 500, 0, 700, 0, 1000, 0, 1200 - среднее 485,7
Вариант Б: 3000, 800, 200, 0, 500, 0, 0 - среднее 642,85

Если посмотреть просто на выборки, то мы можем сказать, что среднее значение выборки Б больше А. В АБ тесте хотя мы и собираем выборки нас не интересует вопрос среднее какой из выборок больше.

Нас интересует другой вопрос, среднее в генеральной совокупности для какого из вариантов больше? Т.е. нас интересует, вот если бы мы могли взять собрать и замерить покупки всех возможных потенциальных пользователей сайта, то средняя сумма покупки в каком варианте была бы больше?

Но тут встают 2 проблемы
1. Мы не можем собрать всех потенциальных пользователей и оценить по ним метрику.
Т.к. это зачастую просто не реально, мы не можем дотянуться до всех.

2. Полученный набор значений в выборке может плохо отражать реальную ситуацию(среднее) в ГС.
Например, если бы мы провели эксперимент повторно и набирали бы выборки из той же самой ГС, то могли получить какие-то другие значения в выборках

Например
Вариант А: 300, 400, 3000, 0, 100, 600, 500 - среднее 700
Вариант Б: 0, 200, 900, 700, 2000, 0, 0 - среднее 542

Теперь среднее выборки А получилось больше чем Б, хотя мы брали данные из той же генеральной совокупности. Почему выборки взятые из одной и той же ГС могут отличаться?

1 - В силу того что мы случайно отбираем пользователей в группы и вот чисто в силу случая в одну выборку попало больше тех кто заплатил больше.
2 - Дисперсия. Это мера разброса(изменчивости) значений метрики.

Представим, что мы проводим АБ тест и знаем, что если мы покажем вариант А, то все будут покупать на 100, а если вариант Б то на 200.

Вариант А: 100, 100, 100, 100, 100, 100, 100 - среднее 100
Вариант Б: 200, 200, 200, 200, 200, 200, 200 - среднее 200

В данном случае у нас дисперсия будет равна 0. Т.е. нет никакой изменчивости по наблюдениям, они все одинаковы в рамках выборок и ГС.

Если бы мы знали, что у метрики нет никакой изменчивости, т.е. все значения наблюдений будут одинаковыми, то тогда бы нам и АБ тест в принципе был не нужен.

Мы могли бы получить просто по 1 значению в каждый из вариантов и тот в котором это наблюдение будет больше тот вариант и лучше, т.к. мы знаем что все остальные наблюдения и все значения в ГС будут точно такими же.

Но в реальности у нас всегда есть дисперсия, т.е. изменчивость значений и чем больше значения отличаются между собой внутри выборок, тем сложнее нам на глаз определить, а есть ли разница между выборками и экстраполировать этот вывод на ГС.
  • 🔥 30
  • 👍 11
  • ❤ 3
  • ❤‍🔥 2
More from @y_borzilo
  1. Aug 4, 2026Сегодня мне 36 годиков🤠 Утром сходил на тренировку, скоро буду кушать торт, а вечером про…
  2. Jun 30, 2026Мифы АБ тестирования. Часть 3 Миф 1. Рандомизация создает абсолютно одинаковые группы Реал…
  3. Jun 24, 2026Проанализировал отзывы при помощи ИИ 🤖 Уже накопилось достаточно много отзывов о курсе и…
  4. Jun 22, 2026Артефакты курса по АБ тестам В прошлом посте я анонсировал набор на 6 поток курса по АБ те…
  5. Jun 18, 2026📣 6 поток курса по АБ тестированию 30 июня планирую запуск 6 потока курса по АБ тестирова…
  6. Jun 16, 2026После прохождения 6 занятий статистика стала понятней - сложилась единая картина Еще один…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →