👎
Как «накрутить» связь между переменными, не подделывая данные?В своем исследовании Кфир Элиаз, Ран Шпиглер и Яир Вайс (Eliaz, Spiegler, Weiss, 2021) задаются простым, но фундаментальным вопросом:
Насколько сильно может быть искажена оценка корреляции между переменными, если модель, используемая для интерпретации данных, является ошибочной, но при этом проходит тест на корректность?
😢
Почему это важно?🟤Модели – основа решений: научных, политических, экономических. Ошибки в модели могут приводить к ложным выводам и дорогостоящим последствиям
(Piccione, Rubinstein, 2003;
Eyster, Piccione, 2013)🟤Манипуляции нарративами: политики и медиа могут использовать ложные причинные объяснения для искажения реальности и влияния на общественное мнение
(Eliaz, Spiegler, 2018)
🟤
Стимулы к преувеличению: учёные заинтересованы в демонстрации «сильных» результатов, что подталкивает к оппортунистическому выбору структуры модели
(Eyster, Rabin, 2005)🟤Когнитивные искажения: люди плохо распознают каузальные ошибки и легко верят правдоподобно выглядящим моделям
(Spiegler, 2020)Формальные основы этих искажений: ограниченная рациональность
(Piccione, Rubinstein, 2003;
Jehiel, 2005), «проклятые убеждения» (cursed beliefs)
(Eyster, Rabin, 2005), конкурирующие нарративы и модели
(Eliaz, Spiegler, 2018;
Montiel Olea et al., 2018)😢
Базовая постановка задачи 🟤У вас есть реальные, «чистые» данные по многим переменным
🟤Вы не фальсифицируете данные
🟤Но вы можете выбирать какие переменные включать в модель, и как связать их между собой
Цель: убедить аудиторию, что две переменные тесно связаны, даже если на самом деле они независимы
Ограничение: модель должна сохранять предельные распределения (marginal distributions) – модель не должна искажать распределение каждой переменной по отдельности
Суть в том, что даже неспециалист может заметить явные манипуляции в вашей модели, например, если она утверждает, что средний доход равен $200 000, когда в данных – $30 000 (такое ограничение называется Undistorted Marginals Constraint). Но при этом зависимости между переменными (корреляции, причинные связи) – уже не так просто проверить. И именно тут начинается «читерство»
😢
Как работает «обман»?🟤Исследователь строит направленный ациклический граф (DAG) – стандарт в байесовских сетях и в теории причинности
(Pearl, 2009;
Koller, Friedman, 2009)🟤Он вставляет между интересующими переменными оппортунистически подобранную цепочку медиаторов, усиливающую видимую зависимость между началом и концом цепи
😢
Пример: marker hackingПредставим фармацевтическую компанию, которая хочет доказать, что новое лекарство увеличивает выживаемость. Прямой связи нет, но есть:
🟤Краткосрочные данные о реакции биомаркеров на препарат
🟤Долгосрочные наблюдения о связи биомаркеров с выживаемостью
😢 Она строит модель:
Препарат → Биомаркер → Выживаемость
Если биомаркер подобран правильно, то даже при полном отсутствии реальной связи между препаратом и выживаемостью, модель покажет значимую корреляцию
Это приём называется
marker hacking – отсылка к
p-hacking, но вместо подгонки p-значений происходит подгонка структуры модели. См. также понятие
surrogate paradox в
(VanderWeele, 2015)😢
Главный результатДаже при нулевой реальной корреляции между переменными, можно построить модель, которая покажет почти идеальную зависимость без манипуляций с данными, с сохранением предельных распределений, с использованием легитимного инструментария
😢
Почему это работает?В статье данный результат аккуратно выведен тригонометрически:
если между двумя точками (переменными) разместить цепочку «промежуточных» точек (медиаторов) с маленькими отклонениями, итоговая зависимость между краями может казаться сильной
😢
Выводы🟤Даже «правильная» на вид модель может лгать, если у исследователя есть свобода выбора структуры
🟤Проверка распределений не гарантирует достоверности модели
🟤Чем больше у исследователя переменных (в эпоху Big Data – тысячи), тем легче накрутить корреляции
#канал_обозревает
@causal_channel