TGViewer
A/B Testicles A/B Testicles @abtesticles · 643 subscribers
Post #59 913
Гипотезы

Статистические критерии устроены таким образом, что они позволяют контролировать вероятность ошибки первого рода. Контролю альфы в принципе уделяется очень много времени в статистике. Например, когда речь заходит о подглядывании или о множественных сравнениях. Оно и неудивительно – ведь для нас очень важно случайно не выкатить изменение, которое на самом деле никак не повлияло на метрики. Или не прям важно?

При такой постановке вопроса создается ощущение, что ошибка первого рода – не такая уж и проблема для бизнеса. Ну выкатили и выкатили, ничего не изменилось ведь. Более того, априорная вероятность точечной нулевой гипотезы (H_0 : Δ = 0) равна в точности 0. То есть по большому счету какой-то эффект есть всегда.

После таких мыслей возникает вопрос: а действительно ли нам нужно так сильно переживать об ошибке первого рода, которая, во-первых, не наносит большого вреда бизнесу, а, во-вторых, почти никогда не случается, так как никогда не случается H_0? Может быть и с подглядываниями нет никакой проблемы? Раз эффект есть всегда, то почему бы не детектить его раньше? И вообще, вот бы переделать стат. тесты как-нибудь так, чтобы они контролировали бету, а не альфу. Ведь не упустить улучшение – гораздо более важная задача для нас.

Всё, заканчиваю нести ересь.

На самом деле нулевая гипотеза H_0 : Δ = 0, конечно же, может быть верна как минимум в одном случае – когда мы проводим A/A-тест. Верна она здесь by design. И этот факт позволяет нам валидировать стат. тесты, сплитовалки и тд.

Но важнее другое. Несмотря на то, что формально при проведении экспериментов мы используем двусторонний t-тест, в реальности мы катим только зеленые фичи (в том числе и в сетапе проблемы подглядывания). То есть фактически наша H_0 – это Δ <= 0, а наш критерий – односторонний. Мы делаем вид, что мы контролируем (или завышаем при подглядывании) вероятность зафиксировать эффект при его отсутствии на уровне 5%. Но на самом деле мы контролируем (или завышаем при подглядывании) вероятность выкатить фичу, которая не улучшила метрику или ухудшила её, на уровне не более 2.5%. А это, согласитесь, звучит уже намного приятнее.
  • 👾 10
More from @abtesticles
  1. Jun 24, 2026Джереми Кларксон осваивает бутстрэп https://rutube.ru/video/9b458f07826786d9def20840a74965…
  2. Jun 8, 2026Пост-коллаба вообще со всеми Сережа написал хорошее резюме по стратификации и ее уродливой…
  3. Apr 21, 2026Мой критический обзор на дизайн байерско-селлерского теста Авито Там предлагается провести…
  4. Mar 29, 2026Может ли одна метрика быть чувствительнее другой Была бы у меня возможность – я бы только…
  5. Feb 20, 2026Post #56
  6. Feb 20, 2026Кейс с собеседования Года полтора назад на собесе в Авито мне дали такой кейс: Тестируем ф…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →