Представьте, что мы провели A/B тест (n=1000, H0: µ1-µ2=0, H1: µ1-µ2≠0) и посчитали t-статистику: t = 2.
✝️Интерпретация Фишера: для t=2, df=999, p-valuе = 0.04577 => слабые доказательства простив H0
p-value здесь – выражение непрерывной статистической значимости: чем p-value меньше – тем экспериментальные данные «удивительнее».
Как мы помним, в парадигме Фишера нулевая гипотеза – 100%-верная модель, а масштаб отличий от нее имеет разную градацию удивительности в соответствии с величиной этих различий (исходя из этого и происходит классическое определение: «вероятность получить такие же или более экстремальные значения, при условии, что нулевая гипотеза верна»)
Концептуально, проводя эксперимент, мы хотим получить абсурдно маленькую вероятность того, что наш результат объясняется нулевой моделью.
Мне нравится думать про p-value как о двигателе бесконечной невероятности из «Автостопом по галактике»: в книге Дугласа Адамса, мгновенно оказаться на другом краю вселенной возможно, просто крайне маловероятно (удивительно) – именно эту вероятность и использовал двигатель Золотого Сердца
Хотя, такой двигатель и остается уделом фантастики, статистика умеет находить абсурдно маленькие p-values – это задача воспроизводимости и грамотной постановки экспериментов
В итоге, этот метод дает нам количественную оценку доказательств против H0, которую сам Фишер определял, как просто точку данных, которая не содержит информации о том насколько мы правы, и имеет смысл только как материал для мета-анализа подобных экспериментов
✝️Интерпретация Неймана-Пирсона: при t=2, α = 5, df=999; 2>1.962 (критическое значение для α=5) => принимается H1
Про фреймворк Неймана-Пирсона можно думать как про тест на беременность: есть значения hCG для беременных и не беременных: 1-α – это диапазон концентрации hCG у не беременных (доверительный интервал), а 1-ß – это диапазон концентрации hCG у беременных. Если концентрация hCG у пациентки попадает в интервал 1-α, она не беременна и наоборот. Попадание в области а и ß соответствует ошибкам первого (False-Positive) и второго рода (False-Negative)
Тест помогает ответить на вопрос: «Учитывая концентрацию hCG у пациентки, беременна она (H1) или нет (H0)»?
NB! проводя тест в продукте, мы не знаем какое распределение у H1, но в случае с тестом на беременность аналитическая работа уже проведена: мы доподлинно знаем распределения H0 и H1 и смотрим в какое попадает результат пациентки и это именно тот сценарий, для которого тест Неймана-Пирсона и был изначально разработан!
Фактически – этот подход решает задачу бинарной классификации, где α и ß – являются константами помогающими контролировать ошибки первого и второго рода на большой дистанции экспериментов и не говорят о реальном количестве ошибочных выводов и не гарантируют истинность выбранной гипотезы – мы просто соглашаемся с правилом выбора.
Without hoping to know whether each separate hypothesis is true or false, we may search for rules to govern our behavior with regard to them – Neyman and Pearson
Я надеюсь, что я смог донести фундаментальные различия этих двух подходов, однако, нечто общее у теста на беременность и двигателя бесконечной невероятности, к сожалению, все же нашлось, но об этом я расскажу в следующем посте
#статистика #ab_тесты #product_management #pvalue #гипотезы