Почему дисбаланс выборок считается серьезной проблемой?
Казалось бы, подумаешь планировали разделить трафик 50/50, а получилось 60/40. Почему это проблема?
Идея АБ теста, что мы случайно распределяем пользователей в группы. При таком подходе мы получаем сопоставимые выборки по разным параметрам(гео, источники, браузеры и прочее), а это значит что и метрики этих групп будут равны, если больше нет никаких различий, а единственное отличие это наш тестовый элемент.
Значит мы можем сделать вывод, что только этот элемент влияет на наши метрики, т.к. все остальные параметры аудитории мы уравновесили и контролируем.
Если есть дисбаланс, то это говорит, о том что есть какая-то проблема, возможно в делении пользователей или какая-то разница в страницах: например одна грузится долго и счетчик не успевает отработать или в одном из браузеров новая страница не загружается.
Допустим новая страница не грузится mobile safari, то мы не получим конверсии из этого браузера, а при условии что этот браузер имеет высокую конверсию, то скорее всего выиграет контрольной вариант, т.к. в нем все корректно работает.
Таким образом мы получим не сопоставимые выборки и разница конверсий в эксперименте будет обусловлена не нашим экспериментальным воздействием, а смещением выборок из-за того что состав пользователей по браузерам будет разный.
Как правило в АБ тестах мы стремимся обнаруживать даже малые эффекты (на сколько хватит трафика). А это значит даже малый дисбаланс выборки может дать малое смещение целевой метрики, которое мы обнаружим в АБ тесте и примем это изменение за эффект от нового варианта, хотя это просто будет эффект полученный из-за того что выборки не сопоставимы и в одну из них попало больше пользователей из высококонверсионных сегментов.
Post #546
1.38K
- 👍 13
- 😁 2
- ❤ 1