Не люби µ1-µ2≠0– обманут, не люби α-values – обманут, не люби p-values – обманут, а из всех вин, самое пьянящее на свете – инференционная статистика
Я некоторое время не писал в канал – от части из-за проблем со здоровьем, от части из-за некоторого кризиса тем: совершенно не хотелось писать о чем-то тривиальном. В итоге, мотивацию подарил пост из другого уважаемого канала с обзором на серию критических заявлений об A/B тестах
Я не буду пересказывать пост (это хороший материал, прочитайте его сами), более того, не буду цитировать оригинальные посты, но также рекомендую к прочтению.
Вместо этого я попробую в нескольких частях расширить понимание того, как формуется правильный статистический вывод
Не люби µ1-µ2≠0 – обманут
Статистические гипотезы – это формальная постановка задачи статистического исследования и крайне непрозрачный концепт для интерпретации
Исторически, существовало два подхода к проверке статистических гипотез: метод значимости Фишера (Fisher’s significance testing) и метод проверки гипотез Неймана-Пирсона (Neyman-Pearson’s hypothesis testing framework)
Обзор всех различий в этих методологиях – обширная тема, и сейчас же я остановлюсь на одном единственном различии: интерпретации нулевой гипотезы.
Тестирование статистической гипотезы подразумевает исключительно проверку консервативного утверждения, нулевой гипотезы – допущение о том, что различий между некоторым параметром выборок нет: например разница средних равна нулю: µ1-µ2=0
Нулевая гипотеза в понимании Фишера – математический концепт, теоретическое распределение некоторой случайно величины (например среднего). В парадигме Фишера такое распределение не может быть ложным, не может быть фальсифицируемым – это некоторый 100%-правдивый факт относительно которого мы делаем выводы об «удивительности» экспериментальных данных. Если данные достаточно «удивительны», мы можем сделать заключение об убедительности доказательств простив нулевой гипотезы (обратите внимание – не «принять»), в противном случае уместно заявить о том, что мы «failed to reject the null» – такая хитрая словестная конструкция с двойным отрицанием, лишний раз напоминает то, что you can't prove a negative – почти невозможно доказать то, чего нет
Нулевая гипотеза в понимании Неймана-Пирсона – это одно из двух взаимоисключающих утверждений (второе – это альтернативная гипотеза, которую фреймворк Фишера подразумевает только имплицитно) любое из которых должно быть однозначно принято. Математически, нулевая (или основная, H (main)) гипотеза в этом случае – такое же теоретическое распределение, но философски, мы принимаем его не просто за численный референс, а за валидную модель реального мира, которую мы хотим отвергать как можно реже, в связи с чем, авторы впервые ввели известные всем α и β параметры, а также MDE.
Спустя время, оба фреймворка слилсь в один, чему очень противились все три автора и что очень сильно запутало понимание статистики всеми, кто ее касается. То определение стат. гипотез, которое сейчас можно встретить в непрофильных учебниках по статистике или популярной публицистике уже сильно искажено и упрощено, что неизбежно ведет к неправильным интерпретациям и трактовкам.
✝️Поэтому, как бы мы не думали о нулевых гипотезах, важно понимать одно: «опровержение» (sic!) нулевой гипотезы не говорит о том, что мы получили новое знание и/или что мы однозначно уверены в нем. Оно даже не гарантирует того, что наша альтернативная гипотеза однозначно верна.
Мы, всего лишь, оцениваем полученные данные.
✝️Верно и обратное: если наши данные говорят в пользу нулевой гипотезы – это не значит, что альтернативная гипотеза не верна.
Недостаток доказательств не является доказательством отсутствия эффекта, также как контурная карта по географии не говорит об отсутствии на местности гор, рек и озер.
#статистика #ab_тесты #product_management #pvalue #гипотезы
Post #19
497