В этом случае для нас открывается возможность манипуляций. Например, если с помощью t-критерия Стьюдента не будут получены желаемые различия, можно отказаться от мнения о нормальности распределения и испытать другие критерии: Манна-Уитни, ван дер Вардена, Вальда-Вольфовица, медианный тест Муда и др. Авось где-то p опустится ниже заветных 0.05 и можно будет сделать вывод, что эффект достигнут. Такой подход относится к нежелательному и порицаемому явлению под названием «p-hacking». Надежным средством против него является четкое указание в протоколе, публикуемом до набора данных, какие гипотезы планируется проверять и с помощью каких методов.
Интересно, что даже выбор программы - совсем уже нестатистический фактор! - может повлиять на результаты сравнения. Ведь доступные в одних программах критерии могут отсутствовать в других, что неизбежно приводит к различиям в выводах. Пример такой ситуации с использованием SPSS и Minitab приводят Pearce and Derrick (2019).
Выбирая метод анализа на этапе планирования исследований, можно сослаться на Аддендум по эстимандам к руководству по статистическим принципам для клинических испытаний (ICH E9(R1)). В нем сказано, что эстиманды (оцениваемый эффект, например, разность средних) с основными эстиматорами (метод оценивания, например, t-критерий Стьюдента) должны определяться заранее, на этапе планирования исследования. При этом, конечно, учитываются предположения о популяции и изучаемом параметре, а в случае выявления отклонений от предположений рекомендуется выполнять анализ чувствительности.
Также про опасность манипуляций с выводом можно прочитать у Fay and Proschan (2010).
❗️5️⃣ Использование предварительного тестирования допущений применения статистических методов, таких как нормальность или равенство дисперсий, создает проблемы с контролем ошибок I и II типа.
То есть помимо ошибок проверки статистических гипотез, совершаемых при использовании конкретного метода, которые обычно успешно контролируются самим методом, мы сталкиваемся с вероятностью ошибок, связанных с проверкой допущений. В результате мы можем получить p-значения, значительно отличающиеся от реальных. А может и незначительно… В общем, проверка допущений делает статистический вывод неопределенным.
Какие авторы пишут об этом:
Zimmerman (2004), Wells and Hintze (2007), Rochan et al. (2012), Garcia-Perez (2012)
❗️6️⃣ В случае предполагаемых нарушений допущений статистических тестов (если они все-таки важны), сразу использовать такие методы, которые устойчивы к этим допущениям.
Например, при сомнениях в целесообразности сравнения средних значений можно без каких-либо предварительных проверок отказаться от t-теста в пользу ранговых методов.
Такую рекомендацию в отношении разных параметрических методов можно встретить в работах:
Wells and Hintze (2007), Fagerland (2012), Lantz (2013), Derrick et al. (2017).
Данный принцип также относится к проверке гомоскедастичности (равенства дисперсий). Это допущение является важным при использовании параметрических методов: классического t-теста или F-теста, post-hoc критерия Тьюки, а также непараметрического критерия Манна-Уитни. У каждого из них есть аналоги, устойчивые к нарушению данного допущения: соответственно, t-тест и F-тест Уэлча, тест Геймса-Хауэлла, критерий Бруннера-Мюнцеля. Рекомендуется по умолчанию использовать именно эти аналоги без проверки равенства дисперсий. Симуляции показывают их надежность как при гетеро-, так и при гомоскедастичности.
О предпочтительном использовании теста Уэлча пишут:
Zimmerman (2004), Rash et al. (2011), West (2021).
О предпочтительном использовании критерия Бруннера-Мюнцеля:
Karch (2023), Noguchi at al. (2021), Nowak et al. (2022).
О предпочтительном использовании критерия Геймса-Хауэлла:
Keselman and Rogan (1978).
Все ссылки на упомянутые в этом посте источники, которые могут пригодиться для подготовки ответов рецензентам и для более глубокого погружения в эту тему, приведены в комментариях.