TGViewer
Reliable ML Reliable ML @reliable_ml · 6.6K subscribers
Post #27 2.49K
Почему Correlation != Causation

В недавнем посте мы поговорили о том, что корреляция не подразумевает причинно-следственную связь.

Давайте теперь обсудим, почему это может быть так.
Общепринято выделять 4 причины.

1. Пропущенная переменная (Omitted variable). В случае, если Х и Y скоррелированы, причиной их изменения может быть другой, третий фактор F, воздействие которого и заставляет X и Y двигаться вместе (сонаправленно). Поэтому, если цель нашего исследования – изменить Y, изменение Х нам с этим не поможет. К изменению Y приведет только изменение F.

В нашем недавнем посте можно найти ряд примеров, когда корреляция не означает причинно-следственной связи, именно по причине пропущенного фактора. Так, в корреляции наличия астмы и низкой вероятности смерти от пневмонии третьим фактором оказалось регулярное врачебное наблюдение, необходимое при астме и оказывающее значительное влияние на снижение смерти от пневмонии. А для корреляции ЗП и сексуальной активности третьим фактором, по мнению автора исследования, является состояние здоровья.

2. Обратная причинность (Reverse Causality). Корреляция X и Y не подразумевает, что Х влияет на Y, поскольку влияние может быть обратным – Y влияет на Х. Самым известным примером reverse causality считается взаимосвязь курения и депрессии. Здесь возможна как прямая взаимосвязь (курение способствует депрессии), так и обратная (подавленное состояние способствует курению). Другие примеры из экономической теории: уровень дохода и счастье, бедность и безработица, сексуальная активность и уровень ЗП.

3. Смещение выборки (Selection bias). Третья возможная причина, почему корреляция не подразумевает причинно-следственной связи – нерепрезентативность выборки, на основе которой мы делаем выводы, для генеральной совокупности. Пример – исследование факторов роста заработной платы. При проведении подобного исследования мы неизбежно рассматриваем только работающих и, следовательно, получающих ЗП на текущий момент людей и делаем выводы о факторах, влияющих на их доход. При этом в выборку не попадают неработающие люди (потерявшие работу, матери в декрете, официально безработные, и др.), данные о которых могут значимо повлиять на результат.

4. Ошибка измерения (Measurement error). Способ получения данных и его уязвимости также могут влиять на результат. Самый распространенный пример – систематическое искажение данных в опросах. Так, пациенты могут систематически приукрашивать данные о регулярности приема лекарств и занижать – о приеме алкоголя. В опросах про доходы также часто встречается завышение низкого дохода и занижение высокого. При этом не каждая ошибка измерения приводит к неверным выводам о причинно-следственной связи. В некоторых случаях она может быть вполне безобидной.

#tech #causal_inference
  • 👍 33
  • ❤ 4
More from @reliable_ml
  1. Sep 18, 2026Наслаждаюсь работой на конференции дата-аналитиков на экономическом факультете МГУ. Тут со…
  2. Sep 18, 2026Конференция дата-аналитиков на Экономфаке МГУ Новости за сегодня) Перепост ниже. Прийти на…
  3. Aug 4, 2026Не в тему - но про ИИ Тут пришли ребята (на самом деле девчата, @Antonina_Zhiteneva) - они…
  4. Jul 15, 2026LLM Evaluation как задача Causal Inference #1 Первая заметка серии, посвященной современны…
  5. Jul 14, 2026Ура, доклады с Датафеста! Секция ReliableML Датафеста доступна на сайте ods.ai https://ods…
  6. Jun 17, 2026Каникулы Бонифация Или ML System Design - наше все В этом году устроила для себя необычный…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →