TGViewer
A/B Testicles A/B Testicles @abtesticles · 643 subscribers
Post #25 1.2K
Как случайно не обнулить мощность в A/B-тесте

Я когда провожу собесы, периодически спрашиваю у аналитиков, что такое MDE. В подавляющем большинстве случаев получаю следующий ответ:

MDE – это минимальный эффект, который мы можем обнаружить в эксперименте


Ну, допустим. Давайте рассмотрим такой сеттинг:

◆ Целевое значение MDE = 3%
◆ Длительность теста при целевом MDE = 2 недели
◆ Истинный эффект от фичи (мы его не знаем) = 2%

А теперь 4 простых суждения:

1) 2 < 3
2) Всё, что меньше 3, мы обнаружить не можем
3) Мы не сможем обнаружить истинный эффект, если продержим тест 2 недели
4) Мощность теста равна 0

Кайфово задизайнили

На самом деле мощность такого теста, конечно же, нулю не равна. Всё дело в интерпретации MDE. Верное определение будет таким:

MDE – это эффект, который мы можем обнаружить с заданной вероятностью при использовании статистического теста с выбранным уровнем значимости


В формуле размера выборки есть 3 параметра, которые также присутствуют в формуле z-теста:

◆ z_(1 - α/2)
◆ Var
◆ n

Изменение этих параметров физически влияет на ширину ДИ и размер z-статистики. Они являются характеристиками вашего стат. теста. Они же задают кривую зависимости мощности от размера эффекта (см. скрин в комментах). Так как эта кривая определяется только перечисленными параметрами, её тоже можно рассматривать как характеристику стат. теста.

Изменяя длительность эксперимента, мы сдвигаем кривую таким образом, чтобы нашему целевому MDE на оси x соответствовала мощность 80% на оси y. В реальности мы, как правило, не думаем обо всей кривой, а лишь об этой точке на ней – (целевое MDE, 80%). Из-за этого, а также из-за неудачного нейминга MDE, появляется желание сделать вывод, что эффекты, меньшие чем MDE, мы обнаружить не сможем. Но если построить график такой кривой, становится очевидно, что это не так.

Мы можем обнаружить эффект любого размера.

Это вопрос вероятности. Если истинный эффект будет очень большим, мощность будет близка к 100%. Если истинный эффект будет очень маленьким, мощность будет близка к 5%. Кстати, на моем графике кривые мощности асимптотически приближаются к 2.5%, а не к 5%. Почему так – расскажу в другом посте.

И напоследок хочу обратить внимание еще на одно утверждение, которое часто слышу:

Если мы получили серый результат, из этого следует, что если эффект и есть, то он точно меньше MDE


Это не так. Размер истинного эффекта следует оценивать исходя из границ ДИ. MDE тут не при чём. Мы можем словить ошибку 2 рода (= не обнаружить эффект) как при эффекте, меньшем чем MDE, так и большем. Это опять же вопрос вероятности.
  • 👾 20
More from @abtesticles
  1. Jun 24, 2026Джереми Кларксон осваивает бутстрэп https://rutube.ru/video/9b458f07826786d9def20840a74965…
  2. Jun 8, 2026Пост-коллаба вообще со всеми Сережа написал хорошее резюме по стратификации и ее уродливой…
  3. May 26, 2026Гипотезы Статистические критерии устроены таким образом, что они позволяют контролировать…
  4. Apr 21, 2026Мой критический обзор на дизайн байерско-селлерского теста Авито Там предлагается провести…
  5. Mar 29, 2026Может ли одна метрика быть чувствительнее другой Была бы у меня возможность – я бы только…
  6. Feb 20, 2026Post #56
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →