В своем исследовании Кфир Элиаз, Ран Шпиглер и Яир Вайс (Eliaz, Spiegler, Weiss, 2021) задаются простым, но фундаментальным вопросом:
Насколько сильно может быть искажена оценка корреляции между переменными, если модель, используемая для интерпретации данных, является ошибочной, но при этом проходит тест на корректность?
😢 Почему это важно?
🟤Модели – основа решений: научных, политических, экономических. Ошибки в модели могут приводить к ложным выводам и дорогостоящим последствиям (Piccione, Rubinstein, 2003; Eyster, Piccione, 2013)
🟤Манипуляции нарративами: политики и медиа могут использовать ложные причинные объяснения для искажения реальности и влияния на общественное мнение (Eliaz, Spiegler, 2018)
🟤Стимулы к преувеличению: учёные заинтересованы в демонстрации «сильных» результатов, что подталкивает к оппортунистическому выбору структуры модели (Eyster, Rabin, 2005)
🟤Когнитивные искажения: люди плохо распознают каузальные ошибки и легко верят правдоподобно выглядящим моделям (Spiegler, 2020)
Формальные основы этих искажений: ограниченная рациональность (Piccione, Rubinstein, 2003; Jehiel, 2005), «проклятые убеждения» (cursed beliefs) (Eyster, Rabin, 2005), конкурирующие нарративы и модели (Eliaz, Spiegler, 2018; Montiel Olea et al., 2018)
😢 Базовая постановка задачи
🟤У вас есть реальные, «чистые» данные по многим переменным
🟤Вы не фальсифицируете данные
🟤Но вы можете выбирать какие переменные включать в модель, и как связать их между собой
Цель: убедить аудиторию, что две переменные тесно связаны, даже если на самом деле они независимы
Ограничение: модель должна сохранять предельные распределения (marginal distributions) – модель не должна искажать распределение каждой переменной по отдельности
Суть в том, что даже неспециалист может заметить явные манипуляции в вашей модели, например, если она утверждает, что средний доход равен $200 000, когда в данных – $30 000 (такое ограничение называется Undistorted Marginals Constraint). Но при этом зависимости между переменными (корреляции, причинные связи) – уже не так просто проверить. И именно тут начинается «читерство»
😢 Как работает «обман»?
🟤Исследователь строит направленный ациклический граф (DAG) – стандарт в байесовских сетях и в теории причинности (Pearl, 2009; Koller, Friedman, 2009)
🟤Он вставляет между интересующими переменными оппортунистически подобранную цепочку медиаторов, усиливающую видимую зависимость между началом и концом цепи
😢 Пример: marker hacking
Представим фармацевтическую компанию, которая хочет доказать, что новое лекарство увеличивает выживаемость. Прямой связи нет, но есть:
🟤Краткосрочные данные о реакции биомаркеров на препарат
🟤Долгосрочные наблюдения о связи биомаркеров с выживаемостью
😢 Она строит модель:
Препарат → Биомаркер → Выживаемость
Если биомаркер подобран правильно, то даже при полном отсутствии реальной связи между препаратом и выживаемостью, модель покажет значимую корреляцию
Это приём называется marker hacking – отсылка к p-hacking, но вместо подгонки p-значений происходит подгонка структуры модели. См. также понятие surrogate paradox в (VanderWeele, 2015)
😢 Главный результат
Даже при нулевой реальной корреляции между переменными, можно построить модель, которая покажет почти идеальную зависимость без манипуляций с данными, с сохранением предельных распределений, с использованием легитимного инструментария
😢 Почему это работает?
В статье данный результат аккуратно выведен тригонометрически:
если между двумя точками (переменными) разместить цепочку «промежуточных» точек (медиаторов) с маленькими отклонениями, итоговая зависимость между краями может казаться сильной
😢 Выводы
🟤Даже «правильная» на вид модель может лгать, если у исследователя есть свобода выбора структуры
🟤Проверка распределений не гарантирует достоверности модели
🟤Чем больше у исследователя переменных (в эпоху Big Data – тысячи), тем легче накрутить корреляции
#канал_обозревает
@causal_channel
