Не люби α-values – обманут, не люби p-values – обманут
Отвечаю на вопрос, который я задал в предыдущем посте:
NHST (Null Hypothesis Significance Testing) – метод, который объединил две методологии, которые совершенно несовместимы, как философски, так и логически
Каждый раз, когда вы слышите про тестирование статистических гипотез, с большой вероятностью, вы слышите именно про NHST
Интерпретация NHST: при t=2, α = 5, df=999; p-vale(0.04577)<α(0.05) => принимается H1
Практические предпосылки этого смешения более чем понятны: бизнес, как и любая экспериментально-практическая деятельность хочет получить простой ответ на сложный вопрос: что лучше – A или B? Кошки или собаки? Аянами Рэй или Аска?
И NHST дает иллюзию ответа на этот вопрос: в качестве результата мы получаем бинарный ответ – «да» или «нет», а еще и p-value, как показатель статистической значимости.
Попытка усидеть на двух стульях неизбежно влечет за собой противоречия:
✝️Первое противоречие – трактовка выводов:
Метод Неймана-Пирсона – механическая процедура, которая порождает однозначный бинарный ответ, метод Фишера подразумевает непрерывную градацию статистической значимости.
В нашем примере мы отклонили H0, приняв H1 с p-value = 0.04577 (p<α).
И хотя мы в точности следовали процедуре, с точки зрения убедительности доказательств, нет никакой разницы между p=0.04577 или например p=0.06 – это значения одинаковых порядков, которые трактуются как одинаково слабые свидетельства против H0.
Формальное соблюдение неравенства p<α в этом случае не играет роли: статистическая значимость – не бинарный вывод, это градиент убедительности.
✝️Второе противоречие – несовместность нулевых гипотез:
Сравнение α и p-value – исключительно механическое правило принятия решения, сами значения друг с другом никак не связаны по смыслу.
Мы называем α вероятностью ошибки первого рода только потому, что оно соответствует значениям реальных данных, которые находятся в двух или трех стандартных отклонениях от среднего – это все «самые»: самые низкие, самые высокие, самые умные или самые глупые. Мы предполагаем, что распределение альтернативной гипотезы может располагаться внахлест относительно распределения H0, поэтому мы рискуем 5%/ 1% ложноположительных выводов на большой дистанцией измерений.
В свою очередь, p-value ничего не «знает» про α: p-value из мира, где нулевая гипотеза всегда верна и непогрешима
✝️Третье (хоть и не-противоречие) – завышенные ожидания:
Тестируя статистически гипотезы сложно не испытывать соблазн увидеть в результатах больше, чем эти результаты могут сказать.
Бизнес хочет знать: «верна ли выбранная гипотеза, действительно ли A лучше B?» И кажется, что ответ так близок! Ужасно сложное определение p-value про такие же или более экстремальные значения… схлопывается до «вероятность того, что нулевая гипотеза верна».
И вот мы получили p=0.04577, значит ли это, что нулевая гипотеза верна с вероятностью 4%? Теорема Байеса говорит, что реальная, эмпирическая вероятность ошибки первого рода значительно больше – как минимум 20%!
Если попробовать записать это формально, то: p-value = P(наблюдаемый эффект|H0 верна), вероятность того, что нулевая гипотеза верна – P(H0 верна|наблюдаемый эффект) – даже не вдумываясь в эту запись, несложно понять, что такое определение переворачивает направление условности
Так как фриквентистская статистика не может привязать вероятности к гипотезам (распределениям), а только к случайным переменным, чтобы оценить вероятности того, насколько нулевая гипотеза может быть верна, мы вынуждены применить теорему Байеса.
Авторы одной статьи рассчитали разные значения p-value и вероятности отклонить истинную нулевую гипотезу:
При p=0.05 – 23% (но чаще ближе к 50%!!!)
При p=0.01 – 7% (но чаще ближе к 15%!!)
При p=0.001 ~ 1%
Эта запись очень хорошо иллюстрирует тот самый «градиент убедительности»
Тест не дает нам оценку "верности наших гипотез": мы оперируем лишь категориями правдоподобия и убедительности
#статистика #ab_тесты #product_management #pvalue #гипотезы
Post #25
224
- ❤ 6