Из всех вин, самое пьянящее на свете – инференционная статистика
В предыдущем посте я писал о том, что p-value – это градиент убедительности доказательств против нулевой гипотезы. Его величина прямо коррелирует с байесовской эмпирической вероятностью того, что нулевая гипотеза верна – грубо говоря, чем меньше p-value, тем мы уверенне в том, что A на самом деле лучше B. В этом посте я расскажу про три способа применения этого принципа на практике:
✝️ Наивный
Некоторые исследователи предлагают принять пороговое значение для p-value, равное не конвенциональным 0.05 или 0.01, а 0.005 или 0.001
Таким образом, фирма будет игнорировать большую часть результатов экспериментов и/или будет вынуждена повышать их мощность. В любом случае, стоимость эксперимента возрастет кратно, а жесткая стандартизация будет отсекать часть валидных гипотез из-за формального несоответствия стандарту поэтому метод сложно назвать оптимальным.
✝️ Простой, но сложный
A/B эксперименты очень часто проводятся в медицине: почти любой препарат, который выходит на рынок должен подтвердить свою эффективность в рандомизированных клинических испытаниях.
Традиционно, клиническое исследование включает три фазы тестирования на пациентах. Таким образом, один препарат последовательно тестируется, как минимум, три раза еще до того, как попадет в аптеки.
Это хорошо иллюстрирует идею воспроизводимости. Помните, я писал, что Фишер считал p-value не более чем точкой данных для мета-анализа?
Когда мы воспроизводим один эксперимент несколько раз, можно думать, что мы перемножаем значения p-value:
Репликация 1: p-value = 0.05
Репликация 2: p-value = 0.055
Репликация 3: p-value = 0.04
Итоговое p-value = 0.05 x 0.055 x 0.04 = 0.0001
Сама концепция воспроизводимости проста и лежит в основе научного метода. Реплицируемость также помогает избежать необходимости в строгих пороговых значениях p-value. Но в индустрии почти каждая фирма, которая проводит A/B тесты игнорирует этот важнейший принцип – делать один и тот же A/B тест дорого и долго, и бизнес редко когда готов ждать
✝️ Сложный, но простой
До сих пор я рассмотрел формальные процедуры, которые могут сделать вывод более точным. Однако, хороших продактов беспокоит не только проблема выбора между вариантом A и B, а еще и каузальность. Добавляя новый вариант баннера/кнопки/формочки мы не просто хотим понять какой вариант прокрашивает метрику, а проверить в контролируемых условиях наше объяснение того, почему альтернативный вариант может отличаться.
В биостатистике известны критерии каузальности Хила, где стат. значимость (p-value) рассматривается необходимым, но недостаточным критерием наравне с восьмью другими. Другой критерий – Plausibility, как раз про объяснение: исследователя должна существовать внятная гипотеза, которая описывает причину и следствие, еще один – Coherence, про согласованность с общепринятыми фактами.
Вспомните высказывание Карла Сагана: «Экстраординарные заявления требуют экстраординарных доказательств». Хорошая объясняющая модель помогает задавать рамки «экстраординарности» и оценивать достаточный уровень доказательств, который можно интерпретировать как величину p-value
И если я, как продакт, могу объяснить результат, если я контролирую все другие причины, которые могут на этот результат повлиять, результат не противоречит здравому смыслу и т.д., я могу обойтись и без p-value = 0.00001 и с большой вероятностью, буду прав
#статистика #ab_тесты #product_management #pvalue #гипотезы
Post #27
189
Depeche Prod Не люби α-values – обманут, не люби p-values – обманут Отвечаю на вопрос, который я задал в предыдущем посте: NHST (Null Hypothesis Significance Testing) – метод, который объединил две методологии, которые совершенно несовместимы, как философски, так и логически…
- ❤ 5
- 🌚 1