В LinkedIn я наткнулся на пост челика, который решил обсудить — что делать, если у нашего p-value пограничное значение
Мне стало любопытно. Хоть у меня на опыте и десятки тестов, но вот пограничные случаи бывают редко.
Давайте сразу обозначим: p-value=0.05 это очень условная граница и Фишер сам говорил, что это удобная точка, но она не прибита гвоздями
Поэтому глобально, что можно сделать, если вы попали в ситуацию p-value = 0.051 или 0.049:
1️⃣ Вариант 1
«Ну мы очень близко, в целом не рискуем, давайте катить фичу»
— с таким подходом вы может угадаете с этой фичей, но на большом горизонте с кучей экспов вы будете чаще ловить ошибку 1-го рода
2️⃣ Вариант 2
«Давайте подержим эксп еще недельку»
— так как вы будете смотреть на тех же данных, это форма p-hacking’а. Чтобы избежать этого, вам надо делать поправку на уменьшение уровня значимости, а значит вряд ли вы что-то выиграете от этого
3️⃣ Вариант 3
«Давайте повторим тест и сделаем мета-анализ»
— вы катите тест заново и вот у вас два независимых экспа с двумя p-value и вы можете их соединить (см. Stouffers’s Method). Интуитивно: если два независимых экспа показали похожий результат, то это уже верняк
Очевидно, что автор склоняет к третьему варианту 😎
Но есть нюанс! Автор о нем умолчал
Повторять тесты — дорого 🔪
По времени и по деньгам.
Я представил лицо своего продакта, если я предложу ему повторить тест, который мы катили весь последний месяц 😳
А если тесты относительно дешевы, то действительно можно последовать автору. Вот ссылочка на пост в LinkedIn
Этим и сложна аналитика — на одной чаще весов неопределенность и хаос, а на другой время и деньги.
Наверное, поиск лучшего курса размена и делает нас лучшими аналитиками 🧑🍳
