TGViewer
MedData Lab MedData Lab @meddatalab · 392 subscribers
Post #87 291
Множественные сравнения: откуда берутся случайные «находки»

Представьте, что мы одновременно проверяем 20 гипотез. Для каждой используем привычный уровень значимости 0.05.

Даже если на самом деле никаких эффектов нет, вероятность получить хотя бы один ложноположительный результат составит:

1 − (1 − 0.05)²⁰ ≈ 0.64
То есть около 64%.

Откуда столько?

В одном тесте вероятность не получить ложноположительный результат — 0.95. Если провести 20 независимых тестов, вероятность, что ни один из них не даст ложноположительного результата:
0.95²⁰ ≈ 0.36

А значит, вероятность получить хотя бы один — около 64%.

Именно здесь возникает проблема множественных сравнений.

Теперь представим реальную задачу: например, мы анализируем RNA-seq и сравниваем экспрессию 20 000 генов между двумя группами. Для каждого гена проверяется отдельная статистическая гипотеза и получается своё p-value.

Если просто использовать для всех генов порог p < 0.05, среди «значимых» результатов неизбежно появятся случайные находки.

Поэтому при множественных сравнениях p-value необходимо корректировать.

Один из вариантов — поправка Бонферрони.

Логика очень простая: допустимый уровень ошибки делится на число проведённых тестов.
Для 20 тестов:

0.05 / 20 = 0.0025

Теперь результат отдельного теста должен иметь p < 0.0025, чтобы считаться статистически значимым.

Так мы контролируем FWER (family-wise error rate) — вероятность получить хотя бы один ложноположительный результат среди всего набора тестов.

Это довольно строгий подход. И иногда — слишком строгий.
Если одновременно тестируются 20 000 генов, порог Бонферрони составит:

0.05 / 20 000 = 2.5 × 10⁻⁶

При таком пороге вместе со случайными находками легко потерять и реальные эффекты.

Поэтому в исследованиях, где одновременно проверяются тысячи гипотез, часто используют другой принцип — FDR (false discovery rate).

Один из наиболее распространённых методов его контроля — поправка Бенджамини–Хохберга.

Здесь мы задаём уже другой вопрос.
Не:
«Как сделать так, чтобы вероятность хотя бы одной ложной находки была не больше 5%?»
А:
«Как контролировать долю ложных находок среди результатов, которые мы назвали значимыми?»

Это менее строгий подход, чем контроль FWER, зато он позволяет сохранить больше реальных сигналов. Поэтому FDR широко используют в поисковых исследованиях, в том числе при анализе омиксных данных.

Именно поэтому в результатах RNA-seq нас обычно интересует не только исходный p-value, но и скорректированный p-value (padj).
Кстати, padj и q-value часто используют почти как синонимы, но строго говоря, это не одно и то же.

Какую поправку выбирать?

Зависит от задачи.
Если особенно важно минимизировать вероятность хотя бы одного ложноположительного вывода — нужен контроль FWER.

Если одновременно проверяется множество гипотез и важно не потерять реальные находки — чаще выбирают контроль FDR.

Поэтому вопрос при множественном тестировании не только в том, «какое получилось p-value?», но и в том, какую ошибку мы хотим контролировать.

Benjamini Y, Hochberg Y. Controlling the false discovery rate: a practical and powerful approach to multiple testing. J R Stat Soc Series B. 1995;57(1):289–300
  • 🔥 12
  • ❤ 4
  • 👍 1
  • 🤩 1
  • 🤓 1
More from @meddatalab
  1. Sep 21, 2026Вернёмся к голосовалке из прошлого поста. Напомню условие: исследование сравнивало два мет…
  2. Sep 16, 2026Я снова студент 😏 Теперь — магистратуры ВШЭ. Так что посты могут иногда выходить чуть реж…
  3. Sep 10, 2026Post #106
  4. Sep 10, 2026p = 0,2. Значит, эффекта нет? Наверняка вы встречали в статьях что-то вроде: «Статистическ…
  5. Sep 3, 2026Когда данные слишком красивые В конце августа 2011 года трое молодых исследователей из Til…
  6. Aug 31, 2026Почему не каждую переменную нужно включать в модель: конфаундер vs коллайдер Когда мы стро…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →