Часть 3. Почему метрики посчитанные на основе сеансов плохо подходят для оценки АБ тестов?
третья причина - метрики посчитанные на основе сеансов могут давать высокий false positive rate.
Это наверное самая неочевидная причина, но при этом самая опасная.
Попробую объяснить на пальцах. Например мы запускаем 100 АА тестов, т.е. тестов когда никакой разницы в вариантах нет, при выбранном уровне альфа в 5%. Примерно в 5 экспериментах из 100 мы увидим стат значимые отличия в вариантах между которыми на самом деле различий нет, это просто будет случайность и это нормально, мы это принимаем и живем с этим.
Когда мы используем метрики посчитанные на основе сессий, такие метрики становятся так называемыми ratio метриками. Изначальное требование для применения классических стат тестов - это независимость наблюдений, в случае если мы применяем сессии, то мы нарушаем это требование, т.к. сессии зависимы между собой, т.к. принадлежат одному пользователю.
Если мы применим к таким данным классический t test или z test, то можем получить очень большую вероятность ложных срабатываний. Выше я приводил пример, что мы ошибаемся в 5 случаях из 100 когда разницы нет. А в случае с ratio метриками этот процент будет выше.
На этой неделе я исследовал данные ряда АА тестов и рассчитал долю ложно положительных срабатываний на основе метрики конверсии посчитанной по сессиям, доля ложноположительных результатов составила от 12 до 40%, что гораздо выше ожидаемых 5%, при этом показатель конверсии посчитанный по пользователям сохранял эту ошибку в районе 5% во всех АА тестах.
Если хотите подробнее разобраться в этой проблеме, то вот несколько материалов
А/Б тесты с метрикой отношения. Дельта-метод
АБ тесты с метриками отношений
Post #418
1.79K
- 👍 14
- ❤ 1
- 🐳 1