- Является ли удачный АБ-тест доказательством продуктовой гипотезы?
Строго говоря, нет. Успешный тест является фактом, с которым сложно поспорить, но поспорить все же можно: дело в том, что в рамках дизайна теста всегда есть уровень значимости, - альфа, - как предел ошибки 1-го рода. Ошибка 1-го рода - это вероятность обнаружить эффект там, где его на самом деле нет. Поэтому если тест удачный (то есть прокрасился в нужную сторону), то мы вполне могли совершить ошибку 1 рода, то есть узнаем тогда и только тогда, когда выкатит в прод протестированную фичу.
Другое дело, что если ошибка 1-го рода у нас задана как маленькая, то это весомый аргумент в пользу того, что успешность неслучайна.
- Является ли неудачный АБ-тест доказательством ложности продуктовой гипотезы?
Тоже нет. Неудачный тест это также факт, который оспорим со стороны другой ошибки - ошибки 2-го рода как вероятности не обнаружить эффект там, где он есть. Если тест неудачный (не прокрасился), то это не значит, что закладываемого заранее минимального на обнаружение эффекта не было, мы могли совершить ошибку 2-го рода. Об этом мы вряд ли узнаем, так как неудачный тест в прод обычно не катят.
Другое дело, что у нас ошибка 2-го рода тесно связана с мощностью: вероятностью обнаружить эффект там, где он есть. Мощность = “100% - ошибка 2-го рода”. Отсюда если у вас заложена большая мощность перед тестом, то это весомый аргумент, что такого эффекта продуктовая гипотеза не имеет.
—-
Отдельно отмечу, что названия “ошибка 1 и 2 рода” в контексте возможности их совершить, когда ты читаешь про них без понимания их сути, кажутся сбивающими с толка по одной простой причине: не очень-то “ошибки” любят, далее начинают посещать мысли “а поэтому почему бы и не минимизировать/не избавиться от них”? Это невозможно по двум причинам:
во-первых, они имеют вероятностный характер и обнулить их не выйдет, во-вторых,
устремление вероятности этих ошибок к нулю потребует от вас бесконечного размера выборок.
Лучше думать о этих ошибках согласно их определению, а не названиям:
- Какую выставим вероятность обнаружить эффект там, где его на самом деле нет?
- Какую выставим вероятность НЕ обнаружить эффект там, где он есть?
или, - что больше распространено, так как вместо ошибки 2-го рода мы используем мощность:
- Какую выставим вероятность обнаружить эффект там, где его на самом деле нет?
- Какую выставим вероятность обнаружить эффект там, где он есть?
—-
Сами тесты, если коротко, вообще ничего не знают о том, что ложь или истина. Они лишь говорят то, что говорят: вот тебе распределение для нулевой гипотезы (когда эффекта нет), а вот твоё значение статистики теста, оно лежит на распределении вот тут, вот тебе p-value как вероятность получить такое же экстремальное или еще экстремальнее значение при верности нулевой гипотезы. Как тебе с этим? Как тебе это значение в сравнении с пороговыми? Далее наступает этап ваших решений.
P.S. Если вам половина текста показалась птичим языком, то добро пожаловать на следующей поток по базе :)
Post #8
510
- 👍 4
- ❤ 1
- 🔥 1