TGViewer
medstatistic medstatistic @medstatistic_ru · 4.35K subscribers
Post #318 1.27K
Эта тема вот уже не первый год будоражит все статистические чаты.

Проверять или не проверять количественные данные на нормальность распределения перед анализом количественных данных?

Начну с истории. Некоторые коллеги-математики и биостатистики удивляются популярности алгоритма выбора метода в зависимости от нормальности распределения в медицинских исследованиях. Возможно, мой краткий экскурс раскроет некоторые предпосылки этого явления. Сразу оговорюсь, что эта история включает мои личные оценки, как непосредственного свидетеля и участника описываемых событий.

Когда-то давным-давно в самом начале нулевых в медицинском вузе нас учили, что сравнивать количественные показатели в двух группах нужно с помощью t-критерия Стьюдента. Мы вручную рассчитывали его по формуле, а потом по таблице критических значений при уровне значимости 0.05 определяли, «достоверны» ли различия. Думаю, что эти задачи до сих пор решаются на кафедрах оргздрава или медицинской статистики.

Конечно, нам рассказывали о непараметрических (ранговых) критериях. Но только очень кратко, вскользь. То есть мы знали, что они существуют, и могут применяться в каких-то случаях вместо t-критерия Стьюдента. Но что это за случаи - нам не рассказывали. Например, в учебнике по общественному здоровью и здравоохранению Миняева и Вишнякова (изд. МедПресс-Информ), который использовался на кафедре в качестве основного учебного пособия, непараметрическим критериям была посвящена всего одна страница.

Если взять отечественные медицинские статьи и диссертации 90-х или ранних нулевых годов, в большинстве из них мы не встретим непараметрических критериев. И нормальность данных тогда никто не проверял.

В тех работах использовался алгоритм №1:
1️⃣ Всегда используем параметрические методы.

И вдруг мы узнали, что, оказывается, делаем все неправильно. Оказывается, t-критерий Стьюдента, как и другие параметрические методы, можно использовать только при определенных условиях. Причем эти условия выполняются очень редко, намного реже, чем не выполняются. Среди этих условий - та самая нормальность распределения и ещё одно свойство с длинным названием «гомоскедастичность», т.е. равенство дисперсий.

В научных журналах и в интернете появилось большое число статей, где рекомендовался алгоритм №2:
1️⃣ Проверяем выборочные данные на нормальность распределения какими-либо методами.
2️⃣ (факультативно) При сравнении независимых групп проверяем также равенство дисперсий в группах.
3️⃣ Если данные нормально распределены, используем параметрические методы.
В случае использования п.2: при равенстве дисперсий применяем t Стьюдента или F Фишера. Если дисперсии не равны - применяем t или F Уэлча.
4️⃣ Если распределение отличается от нормального, используем непараметрические (ранговые) методы.
  • 👍 15
  • 🔥 7
  • 👏 5
  • ❤ 4
More from @medstatistic_ru
  1. Sep 20, 2026У StatTech вышла новая версия - 4.16. В новой версии появились онлайн-калькуляторы от наше…
  2. Sep 13, 2026Деревья решений - способ визуализации предсказательной модели, понятный даже ребенку Этот…
  3. Sep 5, 2026Однажды во время обеда с коллегами мы обсуждали ИИ и вдруг речь зашла о том, какой бы путь…
  4. Sep 3, 2026Если Вы хотите значительно расширить свои возможности в решении исследовательских задач, п…
  5. Aug 28, 2026p = 0,01. Новый протокол работает? Часть 2 — разбираем данные в R В первой части этого кей…
  6. Aug 28, 2026Простой пример того, как конфаундеры мешают правильно оценить различия и как мы можем устр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →