Post #50
1.46K
Стреляем себе в ногу с помощью критерия Манна—Уитни!
Критерий Манна—Уитни это замечательный двухвыборочный критерий для нулевой гипотезы
Критерий имеет массу достоинств:
+ он непараметрический, то есть не делает никаких предположений о распределениях X и Y;
+ он точный, то есть его ошибка первого рода равна выбранному уровню значимости;
+ он устойчив к выбросам: если большие значения заменить на очень большие, то на результате это не скажется;
+ его можно применять к порядковым данным, то есть данным, для которых мы можем определить отношения больше/меньше, но не можем численно выразить разницу (скажем, сравнение вкуса двух видов вина);
...и один неприятный недостаток:
– нас не интересует гипотеза
По жизни нам интересно, совпадают ли распределения X и Y? Или еще чаще, совпадают ли матожидания X и Y? С обеими этими гипотезами критерий работает так себе:
‣ Если распределения равны (и непрерывны), то конечно
‣ Равенство матожиданий, в свою очередь, вообще никак не связано с
Хозяйке на заметку:
Почему критерий Манна—Уитни тем не менее используют в A/B-тестах? Скажем, всеми любимые 🤩бакетные тесты🤩 это часто именно Манн—Уитни поверх бакетного преобразования метрики. Жмите 👀, если хотите постик про бакетные тесты.
Ну потому что всем пофиг, что там проверяет критерий на самом деле. Наверное можно поверить, что в типичных A/B-тестах результаты в контрольной и тестовой группах не отличаются, то есть нулевая гипотеза это не просто равенство матожиданий, а равенство распределений, а если и отличаются, то это приводит к небольшому сдвигу всего распределения в какую-то из сторон, который и ловит критерий. В случае бакетных тестов на больших объемах выборки это в целом звучит правдоподобно, но все равно кажется, что в ситуациях с большими и странными эффектами (скажем, среднее немного уменьшилось, но ощутимо увеличилась дисперсия) даже разумный объем выборки может не спасти.
Критерий Манна—Уитни это замечательный двухвыборочный критерий для нулевой гипотезы
P(X < Y) = 0.5 против альтернативы, что эта вероятность не равна/больше/меньше 0.5. Проверяет он ее непосредственно: по выборкам иксов и игреков считаем долю пар вида x_i < y_j. Если эта доля близка к 0.5, то не отклоняем гипотезу, а если нет, то отклоняем.Критерий имеет массу достоинств:
+ он непараметрический, то есть не делает никаких предположений о распределениях X и Y;
+ он точный, то есть его ошибка первого рода равна выбранному уровню значимости;
+ он устойчив к выбросам: если большие значения заменить на очень большие, то на результате это не скажется;
+ его можно применять к порядковым данным, то есть данным, для которых мы можем определить отношения больше/меньше, но не можем численно выразить разницу (скажем, сравнение вкуса двух видов вина);
...и один неприятный недостаток:
– нас не интересует гипотеза
P(X < Y) = 0.5.По жизни нам интересно, совпадают ли распределения X и Y? Или еще чаще, совпадают ли матожидания X и Y? С обеими этими гипотезами критерий работает так себе:
‣ Если распределения равны (и непрерывны), то конечно
P(X < Y) = 0.5, но обратное неверно: рассмотрим, например, X ~ N(0, 1), Y ~ N(0, 4). Это означает, что с ошибкой первого рода все будет ок, но мощность в неудачных случаях может быть очень плохой вне зависимости от объема выборок.‣ Равенство матожиданий, в свою очередь, вообще никак не связано с
P(X < Y) = 0.5. При проверке равенства матожиданий критерий может подвести как угодно: ошибки обоих родов могут непредсказуемо отъехать в любую сторону.Хозяйке на заметку:
Во втором случае проблема с отъехавшей ошибкой первого рода не ловится даже A/A-тестами, так как когда мы делим контроль случайным образом на две группы, мы получаем группы не просто с равными матожиданиями, но и с равными распределениями, для которых критерий точен.
Почему критерий Манна—Уитни тем не менее используют в A/B-тестах? Скажем, всеми любимые 🤩бакетные тесты🤩 это часто именно Манн—Уитни поверх бакетного преобразования метрики. Жмите 👀, если хотите постик про бакетные тесты.
- 👀 32
- 🔥 5
- ❤ 1
















