TGViewer
MedData Lab MedData Lab @meddatalab · 391 subscribers
Post #103 210
Почему не каждую переменную нужно включать в модель: конфаундер vs коллайдер

Когда мы строим регрессионную модель, часто возникает соблазн добавить туда побольше переменных — особенно тех, которые связаны с исходом.
Но больше переменных не всегда означает более корректную модель.

Мы уже разбирали конфаундинг: иногда связь между воздействием и исходом искажается из-за третьей переменной, которая влияет на них обоих. В таких случаях эту переменную важно корректно учесть в анализе.

Но бывает и обратная ситуация: включение дополнительной переменной само создаёт смещение.
Такая переменная может быть коллайдером.

Что такое коллайдер
В простейшей причинной схеме коллайдер — это общее следствие двух переменных:

X → C ← Y

Стрелки как бы «сталкиваются» в C — отсюда и название collider.

В такой схеме наличие общего следствия C само по себе не создаёт дополнительной связи между X и Y. Проблема возникает, когда мы начинаем учитывать C в анализе — например, включаем его в регрессионную модель, стратифицируем по его значениям или ограничиваем выборку на основании его значений. В этом случае между X и Y может появиться искусственная статистическая связь или исказиться уже существующая. Такое смещение называют collider bias.

Классический пример — парадокс Берксона
Эта проблема была описана Джозефом Берксоном ещё в 1946 году при анализе госпитальных данных.

Представим два заболевания, каждое из которых повышает вероятность госпитализации.
Схематично:
Заболевание A → госпитализация ← заболевание B

Если в общей популяции заболевания A и B не связаны, то при анализе только госпитализированных пациентов между ними тем не менее может возникнуть искусственная ассоциация.

Мы фактически отбираем людей по общему следствию двух заболеваний — госпитализации.

Поэтому связи, найденные исключительно в больничной выборке, не всегда отражают связи в исходной популяции. Именно на это обращал внимание Berkson в своей работе о применении таблиц сопряжённости к госпитальным данным.

Пример из пандемии COVID-19
В начале пандемии обсуждалось парадоксальное наблюдение: среди госпитализированных с COVID-19 доля курильщиков в некоторых данных оказывалась ниже, чем ожидалось исходя из распространённости курения в популяции. Появлялись даже предположения о возможном «защитном» эффекте курения.

Одним из возможных некаузальных объяснений была коллайдерная предвзятость.

Данные в начале пандемии часто формировались не из случайной выборки населения, а среди людей, которые были протестированы или госпитализированы. Вероятность попасть в анализируемую выборку могла зависеть одновременно и от изучаемых факторов риска, и от наличия или тяжести COVID-19.

Если анализировать только такую отобранную группу, между факторами могут появляться или искажаться статистические связи, которых нет в общей популяции.

Именно поэтому Herbert и соавт. в 2020 году отдельно предупреждали, что неожиданные наблюдательные связи при COVID-19 могут быть следствием Berkson's paradox / collider bias, а не причинного эффекта.

Чем коллайдер отличается от конфаундера
В простой схеме различие можно показать так:

Конфаундер
X ← C → Y
C влияет и на X, и на Y. Поэтому часть наблюдаемой связи между X и Y может быть обусловлена именно C.
Чтобы уменьшить это искажение, C обычно нужно корректно учесть в анализе.

Коллайдер
X → C ← Y
C, наоборот, является общим следствием X и Y. Пока мы не учитываем C, этот путь не создаёт дополнительной ассоциации между X и Y. Но поправка или отбор по C может такую ассоциацию создать и тем самым внести смещение.

Важно:
список переменных для регрессионной модели нельзя составлять по принципу «добавим всё, что связано с исходом».

Переменная может быть связана и с воздействием, и с исходом — но это ещё не означает, что её нужно включать в модель. Такая поправка не обязательно уменьшит смещение, а иногда, наоборот, может его создать.

Поэтому перед тем как включать переменную в модель, важно понять её место в предполагаемой причинной структуре: что является причиной, что следствием и как учёт этой переменной может повлиять на оцениваемую связь между воздействием и исходом.

Здесь особенно полезны DAG — directed acyclic graphs, причинно-следственные графы.

Статистический критерий сам по себе не скажет нам, что перед нами — конфаундер или коллайдер. Для этого нужна содержательная модель того, как связаны изучаемые переменные.

Источники:
Berkson J. Limitations of the Application of Fourfold Table Analysis to Hospital Data. Biometrics Bulletin. 1946;2(3):47–53. DOI: 10.2307/3002000.
Herbert A, Griffith G, Hemani G, Zuccolo L. The Spectre of Berkson's Paradox: Collider Bias in Covid-19 Research. Significance. 2020;17(4):6–7. DOI: 10.1111/1740-9713.01413.
  • 🔥 5
  • ❤ 3
  • 👍 1
  • 👏 1
  • 🤔 1
  • 🤩 1
  • 🤓 1
More from @meddatalab
  1. Sep 21, 2026Вернёмся к голосовалке из прошлого поста. Напомню условие: исследование сравнивало два мет…
  2. Sep 16, 2026Я снова студент 😏 Теперь — магистратуры ВШЭ. Так что посты могут иногда выходить чуть реж…
  3. Sep 10, 2026Post #106
  4. Sep 10, 2026p = 0,2. Значит, эффекта нет? Наверняка вы встречали в статьях что-то вроде: «Статистическ…
  5. Sep 3, 2026Когда данные слишком красивые В конце августа 2011 года трое молодых исследователей из Til…
  6. Aug 29, 2026MedData Lab pinned «31 августа начинаем третий поток курса по анализу данных в R До старта…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →