TGViewer
Индекс Хирша | PubMed Индекс Хирша | PubMed @hirsch_index_school · 1.38K subscribers
Post #252 493
35-1. Множественные сравнения

На этой неделе мы поговорим о скептическом чтении раздела «Результаты»: навыке, который отличает опытного читателя статьи от новичка. Начнём с ловушки, которую труднее всего заметить, – с множественных сравнений.

Уровень значимости 0,05 означает, что даже при полном отсутствии эффекта мы в 5% случаев получим ложноположительный результат. Пока проверяется одна заранее заданная гипотеза, это приемлемо. Но если в одном исследовании проверяют десятки исходов, подгрупп и моментов времени, вероятность хотя бы одной случайной «находки» стремительно растёт.

Посчитаем. При одном тесте вероятность не получить ложного срабатывания – 95%. При двадцати независимых тестах она равна 0,95 в двадцатой степени – около 36%. Значит, вероятность хотя бы одного ложноположительного результата – около 64%, почти две трети.

Отсюда явление, известное как p-hacking: данные анализируют в разных разрезах, пока какой-нибудь тест не пересечёт порог 0,05, и именно его выносят в выводы. Формально всё верно, по сути – это артефакт множественных сравнений.

Именно поэтому современные стандарты обязывают заранее регистрировать первичный исход – главный вопрос, проверяемый в первую очередь. Прочие исходы объявляются вторичными: они порождают гипотезы, а не выводы. Это не бюрократия, а защита от соблазна выдать случайную находку за открытие.

Когда сравнений всё же много, применяют поправки на множественность (подробный разбор – Schulz & Grimes, Lancet 2005). Например, поправка Бонферрони делит порог значимости на число сравнений: при двадцати тестах значимым считается p менее 0,0025. Но сами авторы разбора относятся к таким поправкам сдержанно, так как они снижают мощность. Дисциплина планирования исследования всегда надежнее, чем правка p задним числом.

При чтении статьи обратите внимание, сколько исходов и подгрупп проверяли авторы и был ли заранее объявлен первичный. Если единственный «значимый» результат найден среди множества проверок и не был запланирован, к нему стоит отнестись с осторожностью. В среду разберём частный, но особенно коварный случай множественных сравнений – анализ подгрупп.

👍 Предыдущая неделя
  • 👍 6
  • ❤ 3
  • 🔥 2
More from @hirsch_index_school
  1. Oct 2, 2026«Спрошу у ИИ – так будет быстрее». Решение понятное. ИИ отвечает за секунды и в любое врем…
  2. Oct 1, 2026REASSurE: как оценить суррогатную конечную точку Суррогатные конечные точки позволяют зако…
  3. Sep 30, 2026Times Higher Education World University Rankings 2027 Сегодня на LinkedIn все обсуждают но…
  4. Sep 30, 2026Дайджест Хирша №9 | Сентябрь 2026 Коллеги, если вы весь сентябрь не включали VPN и не захо…
  5. Sep 30, 2026«Вернусь к статье, когда станет посвободнее» Вполне логичное решение. Особенно если научна…
  6. Sep 29, 2026INSPECT-SR: можно ли доверять данным РКИ 24 сентября в BMJ вышел INSPECT-SR – инструмент о…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →