Я когда провожу собесы, периодически спрашиваю у аналитиков, что такое MDE. В подавляющем большинстве случаев получаю следующий ответ:
MDE – это минимальный эффект, который мы можем обнаружить в эксперименте
Ну, допустим. Давайте рассмотрим такой сеттинг:
◆ Целевое значение MDE = 3%
◆ Длительность теста при целевом MDE = 2 недели
◆ Истинный эффект от фичи (мы его не знаем) = 2%
А теперь 4 простых суждения:
1) 2 < 3
2) Всё, что меньше 3, мы обнаружить не можем
3) Мы не сможем обнаружить истинный эффект, если продержим тест 2 недели
4) Мощность теста равна 0
Кайфово задизайнили
На самом деле мощность такого теста, конечно же, нулю не равна. Всё дело в интерпретации MDE. Верное определение будет таким:
MDE – это эффект, который мы можем обнаружить с заданной вероятностью при использовании статистического теста с выбранным уровнем значимости
В формуле размера выборки есть 3 параметра, которые также присутствуют в формуле z-теста:
◆ z_(1 - α/2)
◆ Var
◆ n
Изменение этих параметров физически влияет на ширину ДИ и размер z-статистики. Они являются характеристиками вашего стат. теста. Они же задают кривую зависимости мощности от размера эффекта (см. скрин в комментах). Так как эта кривая определяется только перечисленными параметрами, её тоже можно рассматривать как характеристику стат. теста.
Изменяя длительность эксперимента, мы сдвигаем кривую таким образом, чтобы нашему целевому MDE на оси x соответствовала мощность 80% на оси y. В реальности мы, как правило, не думаем обо всей кривой, а лишь об этой точке на ней – (целевое MDE, 80%). Из-за этого, а также из-за неудачного нейминга MDE, появляется желание сделать вывод, что эффекты, меньшие чем MDE, мы обнаружить не сможем. Но если построить график такой кривой, становится очевидно, что это не так.
Мы можем обнаружить эффект любого размера.
Это вопрос вероятности. Если истинный эффект будет очень большим, мощность будет близка к 100%. Если истинный эффект будет очень маленьким, мощность будет близка к 5%. Кстати, на моем графике кривые мощности асимптотически приближаются к 2.5%, а не к 5%. Почему так – расскажу в другом посте.
И напоследок хочу обратить внимание еще на одно утверждение, которое часто слышу:
Если мы получили серый результат, из этого следует, что если эффект и есть, то он точно меньше MDE
Это не так. Размер истинного эффекта следует оценивать исходя из границ ДИ. MDE тут не при чём. Мы можем словить ошибку 2 рода (= не обнаружить эффект) как при эффекте, меньшем чем MDE, так и большем. Это опять же вопрос вероятности.