35-1. Множественные сравнения
На этой неделе мы поговорим о скептическом чтении раздела «Результаты»: навыке, который отличает опытного читателя статьи от новичка. Начнём с ловушки, которую труднее всего заметить, – с множественных сравнений.
Уровень значимости 0,05 означает, что даже при полном отсутствии эффекта мы в 5% случаев получим ложноположительный результат. Пока проверяется одна заранее заданная гипотеза, это приемлемо. Но если в одном исследовании проверяют десятки исходов, подгрупп и моментов времени, вероятность хотя бы одной случайной «находки» стремительно растёт.
Посчитаем. При одном тесте вероятность не получить ложного срабатывания – 95%. При двадцати независимых тестах она равна 0,95 в двадцатой степени – около 36%. Значит, вероятность хотя бы одного ложноположительного результата – около 64%, почти две трети.
Отсюда явление, известное как p-hacking: данные анализируют в разных разрезах, пока какой-нибудь тест не пересечёт порог 0,05, и именно его выносят в выводы. Формально всё верно, по сути – это артефакт множественных сравнений.
Именно поэтому современные стандарты обязывают заранее регистрировать первичный исход – главный вопрос, проверяемый в первую очередь. Прочие исходы объявляются вторичными: они порождают гипотезы, а не выводы. Это не бюрократия, а защита от соблазна выдать случайную находку за открытие.
Когда сравнений всё же много, применяют поправки на множественность (подробный разбор – Schulz & Grimes, Lancet 2005). Например, поправка Бонферрони делит порог значимости на число сравнений: при двадцати тестах значимым считается p менее 0,0025. Но сами авторы разбора относятся к таким поправкам сдержанно, так как они снижают мощность. Дисциплина планирования исследования всегда надежнее, чем правка p задним числом.
При чтении статьи обратите внимание, сколько исходов и подгрупп проверяли авторы и был ли заранее объявлен первичный. Если единственный «значимый» результат найден среди множества проверок и не был запланирован, к нему стоит отнестись с осторожностью. В среду разберём частный, но особенно коварный случай множественных сравнений – анализ подгрупп.
👍 Предыдущая неделя
Post #252
493

- 👍 6
- ❤ 3
- 🔥 2