Чем же нас не устраивает алгоритм №2? Тот, который предлагает выбирать критерий исходя из нормальности распределения? К сожалению, для критики есть серьезные основания, подробно представленные в многочисленных источниках.
❗️1️⃣ При достаточно большом числе наблюдений t-критерий Стьюдента, дисперсионный анализ, ковариационный анализ, линейная регрессия устойчивы к отсутствию нормальности распределения.
Стьюдент в своей знаменитой статье “The probable error of a mean” (1908) описал t-критерий исходя из допущения о том, что в популяции показатель имел нормальное распределение. При таком допущении t-критерий является точным тестом и может использоваться для анализа даже небольших выборок.
Но при достаточно большом числе наблюдений t-критерий можно рассматривать как консервативную форму z-теста, не имеющего допущений по форме распределения.
Это подтверждается многочисленными симуляциями, где t-критерий применяли к очень ненормально распределенным данным и всё равно получали корректные выводы о различиях средних значений (справедливости ради отметим, что сценарии, где t-критерий не будет работать, также существуют).
То же относится и к дисперсионному анализу и линейной регрессии. Позволю себе процитировать Norman G., рассмотревшего в своей статье устойчивость ANOVA к нарушениям различных допущений: «
Parametric statistics can be used with Likert data, with small sample sizes, with unequal variances, and with non-normal distributions, with no fear of ‘‘coming to the wrong conclusion’’.»Какие авторы пишут об этом: Feir-Walsh and Toothaker (1974), Driscoll (1996), Scovlund and Fenstad (2001), Fay and Proschan (2010), Norman (2010), Rash et al. (2011), Fagerland (2012), Lumley et al. (2012), Blanca et al. (2023).
❗️2️⃣ Нормальность распределения трудно оценить объективно.
Особенно это актуально для небольшого числа наблюдений. Используемые для оценки нормальности критерии, такие как популярный и рекомендуемый многими авторами критерий Шапиро-Уилка, на малых выборках имеют слишком низкую мощность и могут подтверждать нормальность даже если её нет. Обратная проблема возникает при большом числе наблюдений, когда даже малозначимые отклонения от нормальности сопровождаются выводом об отсутствии нормальности.
Ряд авторов рекомендует использовать для проверки на нормальность графические методы, т.е. визуальное изучение гистограммы или квантильной диаграммы (QQ-plot), но этот подход тоже недостаточно точен. Другими словами, объективная оценка нормальности распределения - слишком сложная задача.
Какие авторы пишут об этом:
Garcia-Perez (2012), Rochon et al. (2012), Kozak and Piepho (2017)
❗️3️⃣ Параметрические и непараметрические критерии не являются взаимозаменяемыми - они решают разные задачи и отвечают на разные вопросы.
Представьте, что нам нужно завернуть шуруп. Но сделать это отверткой затруднительно, например, из-за сбитых шлицов на головке шурупа. И тогда нам предлагают воспользоваться молотком. Конечно, можно забить им шуруп, вот только держаться он будет плохо. Молоток - для гвоздей, отвертка - для шурупов.
Так же, как молоток не заменит отвертку, непараметрические критерии не заменят параметрические, в связи с тем, что проверяют разные гипотезы. Например, t-критерий Стьюдента проверяет, отличаются ли друг от друга средние значения. А непараметрический критерий Манна-Уитни - то, что вероятность бОльших значений в одной из выборок выше, чем в другой.
🔹В тех исследованиях, где важно доказать, что именно средний уровень показателя в одной из групп выше или ниже - мы практически всегда будем использовать t-критерий.
🔹Но иногда нас в меньшей степени интересуют средние значения или их разность, мы бы хотели доказать, что в одной из групп чаще встречаются более высокие значения. В таких случаях мы можем сразу предпочесть критерий Манна-Уитни.
Какие авторы пишут об этом:
Sawilowski and Shlomo (2005), Fay and Proschan (2010), Fagerland (2012), Lumley et al. (2012)
