Почему не каждую переменную нужно включать в модель: конфаундер vs коллайдер
Когда мы строим регрессионную модель, часто возникает соблазн добавить туда побольше переменных — особенно тех, которые связаны с исходом.
Но больше переменных не всегда означает более корректную модель.
Мы уже разбирали конфаундинг: иногда связь между воздействием и исходом искажается из-за третьей переменной, которая влияет на них обоих. В таких случаях эту переменную важно корректно учесть в анализе.
Но бывает и обратная ситуация: включение дополнительной переменной само создаёт смещение.
Такая переменная может быть коллайдером.
Что такое коллайдер
В простейшей причинной схеме коллайдер — это общее следствие двух переменных:
X → C ← Y
Стрелки как бы «сталкиваются» в C — отсюда и название collider.
В такой схеме наличие общего следствия C само по себе не создаёт дополнительной связи между X и Y. Проблема возникает, когда мы начинаем учитывать C в анализе — например, включаем его в регрессионную модель, стратифицируем по его значениям или ограничиваем выборку на основании его значений. В этом случае между X и Y может появиться искусственная статистическая связь или исказиться уже существующая. Такое смещение называют collider bias.
Классический пример — парадокс Берксона
Эта проблема была описана Джозефом Берксоном ещё в 1946 году при анализе госпитальных данных.
Представим два заболевания, каждое из которых повышает вероятность госпитализации.
Схематично:
Заболевание A → госпитализация ← заболевание B
Если в общей популяции заболевания A и B не связаны, то при анализе только госпитализированных пациентов между ними тем не менее может возникнуть искусственная ассоциация.
Мы фактически отбираем людей по общему следствию двух заболеваний — госпитализации.
Поэтому связи, найденные исключительно в больничной выборке, не всегда отражают связи в исходной популяции. Именно на это обращал внимание Berkson в своей работе о применении таблиц сопряжённости к госпитальным данным.
Пример из пандемии COVID-19
В начале пандемии обсуждалось парадоксальное наблюдение: среди госпитализированных с COVID-19 доля курильщиков в некоторых данных оказывалась ниже, чем ожидалось исходя из распространённости курения в популяции. Появлялись даже предположения о возможном «защитном» эффекте курения.
Одним из возможных некаузальных объяснений была коллайдерная предвзятость.
Данные в начале пандемии часто формировались не из случайной выборки населения, а среди людей, которые были протестированы или госпитализированы. Вероятность попасть в анализируемую выборку могла зависеть одновременно и от изучаемых факторов риска, и от наличия или тяжести COVID-19.
Если анализировать только такую отобранную группу, между факторами могут появляться или искажаться статистические связи, которых нет в общей популяции.
Именно поэтому Herbert и соавт. в 2020 году отдельно предупреждали, что неожиданные наблюдательные связи при COVID-19 могут быть следствием Berkson's paradox / collider bias, а не причинного эффекта.
Чем коллайдер отличается от конфаундера
В простой схеме различие можно показать так:
Конфаундер
X ← C → Y
C влияет и на X, и на Y. Поэтому часть наблюдаемой связи между X и Y может быть обусловлена именно C.
Чтобы уменьшить это искажение, C обычно нужно корректно учесть в анализе.
Коллайдер
X → C ← Y
C, наоборот, является общим следствием X и Y. Пока мы не учитываем C, этот путь не создаёт дополнительной ассоциации между X и Y. Но поправка или отбор по C может такую ассоциацию создать и тем самым внести смещение.
Важно:
список переменных для регрессионной модели нельзя составлять по принципу «добавим всё, что связано с исходом».
Переменная может быть связана и с воздействием, и с исходом — но это ещё не означает, что её нужно включать в модель. Такая поправка не обязательно уменьшит смещение, а иногда, наоборот, может его создать.
Поэтому перед тем как включать переменную в модель, важно понять её место в предполагаемой причинной структуре: что является причиной, что следствием и как учёт этой переменной может повлиять на оцениваемую связь между воздействием и исходом.
Здесь особенно полезны DAG — directed acyclic graphs, причинно-следственные графы.
Статистический критерий сам по себе не скажет нам, что перед нами — конфаундер или коллайдер. Для этого нужна содержательная модель того, как связаны изучаемые переменные.
Источники:
Berkson J. Limitations of the Application of Fourfold Table Analysis to Hospital Data. Biometrics Bulletin. 1946;2(3):47–53. DOI: 10.2307/3002000.
Herbert A, Griffith G, Hemani G, Zuccolo L. The Spectre of Berkson's Paradox: Collider Bias in Covid-19 Research. Significance. 2020;17(4):6–7. DOI: 10.1111/1740-9713.01413.
Post #103
210
- 🔥 5
- ❤ 3
- 👍 1
- 👏 1
- 🤔 1
- 🤩 1
- 🤓 1