TGViewer
Depeche Prod Depeche Prod @depecheprod · 91 subscribers
Post #25 224
Не люби α-values – обманут, не люби p-values – обманут

Отвечаю на вопрос, который я задал в предыдущем посте:
NHST (Null Hypothesis Significance Testing) – метод, который объединил две методологии, которые совершенно несовместимы, как философски, так и логически
Каждый раз, когда вы слышите про тестирование статистических гипотез, с большой вероятностью, вы слышите именно про NHST

Интерпретация NHST: при t=2, α = 5, df=999; p-vale(0.04577)<α(0.05) => принимается H1

Практические предпосылки этого смешения более чем понятны: бизнес, как и любая экспериментально-практическая деятельность хочет получить простой ответ на сложный вопрос: что лучше – A или B? Кошки или собаки? Аянами Рэй или Аска?
И NHST дает иллюзию ответа на этот вопрос: в качестве результата мы получаем бинарный ответ – «да» или «нет», а еще и p-value, как показатель статистической значимости.

Попытка усидеть на двух стульях неизбежно влечет за собой противоречия:

✝️Первое противоречие – трактовка выводов:
Метод Неймана-Пирсона – механическая процедура, которая порождает однозначный бинарный ответ, метод Фишера подразумевает непрерывную градацию статистической значимости.
В нашем примере мы отклонили H0, приняв H1 с p-value = 0.04577 (p<α).
И хотя мы в точности следовали процедуре, с точки зрения убедительности доказательств, нет никакой разницы между p=0.04577 или например p=0.06 – это значения одинаковых порядков, которые трактуются как одинаково слабые свидетельства против H0.
Формальное соблюдение неравенства p<α в этом случае не играет роли: статистическая значимость – не бинарный вывод, это градиент убедительности.

✝️Второе противоречие – несовместность нулевых гипотез:
Сравнение α и p-value – исключительно механическое правило принятия решения, сами значения друг с другом никак не связаны по смыслу.

Мы называем α вероятностью ошибки первого рода только потому, что оно соответствует значениям реальных данных, которые находятся в двух или трех стандартных отклонениях от среднего – это все «самые»: самые низкие, самые высокие, самые умные или самые глупые. Мы предполагаем, что распределение альтернативной гипотезы может располагаться внахлест относительно распределения H0, поэтому мы рискуем 5%/ 1% ложноположительных выводов на большой дистанцией измерений.
В свою очередь, p-value ничего не «знает» про α: p-value из мира, где нулевая гипотеза всегда верна и непогрешима

✝️Третье (хоть и не-противоречие) – завышенные ожидания:
Тестируя статистически гипотезы сложно не испытывать соблазн увидеть в результатах больше, чем эти результаты могут сказать.
Бизнес хочет знать: «верна ли выбранная гипотеза, действительно ли A лучше B?» И кажется, что ответ так близок! Ужасно сложное определение p-value про такие же или более экстремальные значения… схлопывается до «вероятность того, что нулевая гипотеза верна».
И вот мы получили p=0.04577, значит ли это, что нулевая гипотеза верна с вероятностью 4%? Теорема Байеса говорит, что реальная, эмпирическая вероятность ошибки первого рода значительно больше – как минимум 20%!
Если попробовать записать это формально, то: p-value = P(наблюдаемый эффект|H0 верна), вероятность того, что нулевая гипотеза верна – P(H0 верна|наблюдаемый эффект) – даже не вдумываясь в эту запись, несложно понять, что такое определение переворачивает направление условности
Так как фриквентистская статистика не может привязать вероятности к гипотезам (распределениям), а только к случайным переменным, чтобы оценить вероятности того, насколько нулевая гипотеза может быть верна, мы вынуждены применить теорему Байеса.
Авторы одной статьи рассчитали разные значения p-value и вероятности отклонить истинную нулевую гипотезу:

При p=0.05 – 23% (но чаще ближе к 50%!!!)
При p=0.01 – 7% (но чаще ближе к 15%!!)
При p=0.001 ~ 1%

Эта запись очень хорошо иллюстрирует тот самый «градиент убедительности»
Тест не дает нам оценку "верности наших гипотез": мы оперируем лишь категориями правдоподобия и убедительности


#статистика #ab_тесты #product_management #pvalue #гипотезы
  • ❤ 6
More from @depecheprod
  1. Jul 14, 2026Немного про контрольные карты Если не чинить то, что сломано — это очевидно плохо, то еще…
  2. May 4, 2026Совершенно случайно обнаружил, что моя книжная полка сама по себе создала ребус. Попробуйт…
  3. Apr 1, 2026Математики 1 апреля #математика #юмор
  4. Apr 1, 2026🤡
  5. Mar 16, 2026Из мухи слона: инкрементальность в продуктовой разработке Я думаю, что все, кто знаком с г…
  6. Jan 26, 2026Первая картинка — типичные пространственные отклонения, которые мы замечаем. Вторая картин…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →