TGViewer
доказательный ⎵ пробел доказательный ⎵ пробел @evidencespace · 1.33K subscribers
Post #371 715

Forwarded from Канал влияния

👎 Как «накрутить» связь между переменными, не подделывая данные?

В своем исследовании Кфир Элиаз, Ран Шпиглер и Яир Вайс (Eliaz, Spiegler, Weiss, 2021) задаются простым, но фундаментальным вопросом:
Насколько сильно может быть искажена оценка корреляции между переменными, если модель, используемая для интерпретации данных, является ошибочной, но при этом проходит тест на корректность?


😢 Почему это важно?
🟤Модели – основа решений: научных, политических, экономических. Ошибки в модели могут приводить к ложным выводам и дорогостоящим последствиям (Piccione, Rubinstein, 2003; Eyster, Piccione, 2013)
🟤Манипуляции нарративами: политики и медиа могут использовать ложные причинные объяснения для искажения реальности и влияния на общественное мнение (Eliaz, Spiegler, 2018)
🟤Стимулы к преувеличению: учёные заинтересованы в демонстрации «сильных» результатов, что подталкивает к оппортунистическому выбору структуры модели (Eyster, Rabin, 2005)
🟤Когнитивные искажения: люди плохо распознают каузальные ошибки и легко верят правдоподобно выглядящим моделям (Spiegler, 2020)
Формальные основы этих искажений: ограниченная рациональность (Piccione, Rubinstein, 2003; Jehiel, 2005), «проклятые убеждения» (cursed beliefs) (Eyster, Rabin, 2005), конкурирующие нарративы и модели (Eliaz, Spiegler, 2018; Montiel Olea et al., 2018)

😢 Базовая постановка задачи
🟤У вас есть реальные, «чистые» данные по многим переменным
🟤Вы не фальсифицируете данные
🟤Но вы можете выбирать какие переменные включать в модель, и как связать их между собой
Цель: убедить аудиторию, что две переменные тесно связаны, даже если на самом деле они независимы
Ограничение: модель должна сохранять предельные распределения (marginal distributions) – модель не должна искажать распределение каждой переменной по отдельности

Суть в том, что даже неспециалист может заметить явные манипуляции в вашей модели, например, если она утверждает, что средний доход равен $200 000, когда в данных – $30 000 (такое ограничение называется Undistorted Marginals Constraint). Но при этом зависимости между переменными (корреляции, причинные связи) – уже не так просто проверить. И именно тут начинается «читерство»

😢 Как работает «обман»?
🟤Исследователь строит направленный ациклический граф (DAG) – стандарт в байесовских сетях и в теории причинности (Pearl, 2009; Koller, Friedman, 2009)
🟤Он вставляет между интересующими переменными оппортунистически подобранную цепочку медиаторов, усиливающую видимую зависимость между началом и концом цепи

😢 Пример: marker hacking
Представим фармацевтическую компанию, которая хочет доказать, что новое лекарство увеличивает выживаемость. Прямой связи нет, но есть:
🟤Краткосрочные данные о реакции биомаркеров на препарат
🟤Долгосрочные наблюдения о связи биомаркеров с выживаемостью

😢 Она строит модель:
Препарат → Биомаркер → Выживаемость
Если биомаркер подобран правильно, то даже при полном отсутствии реальной связи между препаратом и выживаемостью, модель покажет значимую корреляцию

Это приём называется marker hacking – отсылка к p-hacking, но вместо подгонки p-значений происходит подгонка структуры модели. См. также понятие surrogate paradox в (VanderWeele, 2015)

😢 Главный результат
Даже при нулевой реальной корреляции между переменными, можно построить модель, которая покажет почти идеальную зависимость без манипуляций с данными, с сохранением предельных распределений, с использованием легитимного инструментария

😢 Почему это работает?
В статье данный результат аккуратно выведен тригонометрически:
если между двумя точками (переменными) разместить цепочку «промежуточных» точек (медиаторов) с маленькими отклонениями, итоговая зависимость между краями может казаться сильной

😢 Выводы
🟤Даже «правильная» на вид модель может лгать, если у исследователя есть свобода выбора структуры
🟤Проверка распределений не гарантирует достоверности модели
🟤Чем больше у исследователя переменных (в эпоху Big Data – тысячи), тем легче накрутить корреляции

#канал_обозревает
@causal_channel
  • 🔥 8
  • 👍 4
  • ❤ 1
  • 👎 1
More from @evidencespace
  1. Sep 9, 2026🎓Осенняя серия семинаров Chamberlain, 2026–27 11 сентября 2026 в 19:00 (МСК) — тематическ…
  2. Sep 4, 2026📚 Книга по причинному выводу Недавно мы писали про прикладное и облегчённое введение в пр…
  3. Sep 1, 2026Перезапуску «Если быть точным» — три года! С сентября 2023 года «Если быть точным» работае…
  4. Aug 21, 2026⚪️⚪️⚪️В Российской базе бухгалтерской отчетности появились финансовые показатели компаний…
  5. Aug 18, 2026У замечательного эконометриста Скотта Каннингема вышло второе издание его замечательного у…
  6. Aug 15, 2026Cambridge University Press открыл доступ к новой подборке научных статей по экономике. Хор…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →