Всем привет! 🤟
Мы продолжаем разбирать, как множественное тестирование связано с реальными правилами принятия решений в A/B-тестах 📊
Ранее мы уже обсуждали:
— почему возникают множественные проверки гипотез;
— что такое UI/IU testing;
— как success- и guardrail-метрики влияют на корректировки α и мощности;
— и почему классические поправки «в лоб» часто плохо отражают реальные продуктовые процессы.
Но всё это всё ещё было довольно упрощённой моделью.
В реальных A/B-тестах компании почти никогда не принимают решение только по одной success-метрике.
Обычно одновременно требуется:
✅ чтобы хотя бы одна ключевая метрика выросла;
❌ чтобы не появилось статистически значимого ухудшения;
🛡 чтобы сам эксперимент был проведён корректно.
Deterioration- и quality-тесты начинают влиять не только на контроль ошибки I рода, но и напрямую на требуемую мощность эксперимента.
В новом посте разбираю:
• как формализовать production-grade decision rules;
• как корректно распределять α между success-, deterioration- и quality-тестами;
• откуда возникает поправка для β;
Сгенерировал короткие выводы поста в виде картинки - можно забирать и использовать (тестировать).
👉 https://telegra.ph/Mnozhestvennaya-proverka-gipotez-v-AB-Glava-3-CHast-2-05-06
Всем хороших выходных!
Post #72
1.11K

- 🔥 12
- ⚡ 5
- ❤ 4