Представьте, что мы одновременно проверяем 20 гипотез. Для каждой используем привычный уровень значимости 0.05.
Даже если на самом деле никаких эффектов нет, вероятность получить хотя бы один ложноположительный результат составит:
1 − (1 − 0.05)²⁰ ≈ 0.64
То есть около 64%.
Откуда столько?
В одном тесте вероятность не получить ложноположительный результат — 0.95. Если провести 20 независимых тестов, вероятность, что ни один из них не даст ложноположительного результата:
0.95²⁰ ≈ 0.36
А значит, вероятность получить хотя бы один — около 64%.
Именно здесь возникает проблема множественных сравнений.
Теперь представим реальную задачу: например, мы анализируем RNA-seq и сравниваем экспрессию 20 000 генов между двумя группами. Для каждого гена проверяется отдельная статистическая гипотеза и получается своё p-value.
Если просто использовать для всех генов порог
p < 0.05, среди «значимых» результатов неизбежно появятся случайные находки.Поэтому при множественных сравнениях p-value необходимо корректировать.
Один из вариантов — поправка Бонферрони.
Логика очень простая: допустимый уровень ошибки делится на число проведённых тестов.
Для 20 тестов:
0.05 / 20 = 0.0025
Теперь результат отдельного теста должен иметь
p < 0.0025, чтобы считаться статистически значимым.Так мы контролируем FWER (family-wise error rate) — вероятность получить хотя бы один ложноположительный результат среди всего набора тестов.
Это довольно строгий подход. И иногда — слишком строгий.
Если одновременно тестируются 20 000 генов, порог Бонферрони составит:
0.05 / 20 000 = 2.5 × 10⁻⁶
При таком пороге вместе со случайными находками легко потерять и реальные эффекты.
Поэтому в исследованиях, где одновременно проверяются тысячи гипотез, часто используют другой принцип — FDR (false discovery rate).
Один из наиболее распространённых методов его контроля — поправка Бенджамини–Хохберга.
Здесь мы задаём уже другой вопрос.
Не:
«Как сделать так, чтобы вероятность хотя бы одной ложной находки была не больше 5%?»
А:
«Как контролировать долю ложных находок среди результатов, которые мы назвали значимыми?»
Это менее строгий подход, чем контроль FWER, зато он позволяет сохранить больше реальных сигналов. Поэтому FDR широко используют в поисковых исследованиях, в том числе при анализе омиксных данных.
Именно поэтому в результатах RNA-seq нас обычно интересует не только исходный
p-value, но и скорректированный p-value (padj).Кстати,
padj и q-value часто используют почти как синонимы, но строго говоря, это не одно и то же.Какую поправку выбирать?
Зависит от задачи.
Если особенно важно минимизировать вероятность хотя бы одного ложноположительного вывода — нужен контроль FWER.
Если одновременно проверяется множество гипотез и важно не потерять реальные находки — чаще выбирают контроль FDR.
Поэтому вопрос при множественном тестировании не только в том, «какое получилось p-value?», но и в том, какую ошибку мы хотим контролировать.
Benjamini Y, Hochberg Y. Controlling the false discovery rate: a practical and powerful approach to multiple testing. J R Stat Soc Series B. 1995;57(1):289–300