TGViewer
Канал влияния Канал влияния @causal_channel · 1.43K subscribers
Post #194 1.34K
🍸 Смешать, но не взбалтывать: как объединить эксперимент и наблюдаемые данные?

Прикладные исследователи часто сталкиваются с дихотомией выбора:
🟤Использовать экспериментальные данные – надёжные, но дорогие и почти всегда маленькие
🟤Или наблюдаемые данные – большие, дешёвые, но зачастую смещённые из-за скрытых факторов

Проблема одновременного использования экспериментальных и наблюдаемых данных давно будоражит умы исследователей. Например, тут мы писали о том, как оценить эффект воздействия, если в эксперименте нет интересуемого исхода

Сюзан Эти и Хидо Имбенс с коллегами из Беркли (Yang, Lin, Athey, Jordan, Imbens, 2025) снова порадовали нас элегантным решением – Cross-Validated Causal Inference (CVCI)

🤔 В чём идея?
Вместо попыток моделировать смещение наблюдаемых данных или придумывать корректировки, авторы предлагают простой принцип:
Позвольте эксперименту решить, насколько можно доверять наблюдениям

Эксперимент используется как источник истины, а наблюдаемые данные как дополнительный ресурс, который может уменьшать дисперсию только если это безопасно с точки зрения несмещенности оценки

🎪 Как устроен фокус?
🟤Определяем общую модель, которая содержит полный набор параметров и из которой можно извлечь интересующий эффект
🟤Задаём две функции качества: одна отражает, насколько хорошо предполагаемый эффект согласуется с экспериментальными данными (experimental loss); вторая – насколько хорошо модель объясняет наблюдаемые данные (observational loss)
🟤Объединяем эти две функции через весовой коэффициент λ, который регулирует долю влияния наблюдаемых данных по сравнению с экспериментальными
🟤Разбиваем экспериментальные данные на несколько фолдов (k-fold, части данных, на которых проводятся итерации кросс-валидации), чтобы иметь возможность проверять модель на части эксперимента, не участвующей в обучении
🟤Перебираем возможные значения веса λ: для каждого веса обучаем модель на всех наблюдаемых данных и на части экспериментальных; затем проверяем, насколько хорошо модель с этим весом воспроизводит экспериментальные результаты на отложенном фолде; усредняем ошибки по всем фолдам и получаем оценку качества для данного веса
🟤Выбираем вес λ, при котором согласие с экспериментальными данными наилучшее – так модель определяет, насколько наблюдениям можно доверять
🟤Заново оцениваем модель на всех данных с найденным λ
и извлекаем итоговую оценку эффекта

📊 Почему это важно?
🟤В реальной жизни эксперименты редко бывают большими – они стоят дорого и сложны в организации. Наблюдаемые данные дешевле, но часто несут риск смещения. Обычно исследователь вынужден выбирать, какие издержки ему нести – потратиться на эксперимент или мучиться со смещёнными данными
🟤CVCI снимает необходимость такого выбора. Модель сама определяет, сколько "доверия" можно позволить наблюдаемым данным: кросс-валидация сравнивает качество модели с экспериментальной оценкой и адаптивно регулирует вес λ
🟤В лучшем случае оценка остается несмещённой и становится значительно точнее благодаря большему числу наблюдений. В худшем – она остаётся сопоставимой с чистым экспериментом

💻 А что показала проверка на реальных данных?
🟤Авторы протестировали метод на классическом наборе LaLonde
🟤Результат получился очень показательным: без ковариат модель почти не использует наблюдаемые данные (λ̂≈0) – они явно вредят точности; с ковариатами наблюдения становятся полезными, и модель даёт им значимый вес (λ̂≈0.6-0.8); оценки ATE оказываются ближе к экспериментальным и часто точнее, чем чистый RCT
🟤CVCI не ухудшил результат по сравнению с экспериментом – в худшем сценарии он просто вернулся к чистой экспериментальной оценке

🖥 Хочу так же!
Авторы завели страницу для проекта. Там уже можно найти код на питоне и другие дополнительные материалы

#канал_обозревает
#канал_рекомендует
@causal_channel
  • ❤ 25
  • 🔥 7
  • ✍ 4
More from @causal_channel
  1. Oct 9, 2026🧠 Можно ли научить чиновников понимать причинность? Для доказательной политики недостаточ…
  2. Oct 6, 2026Post #304
  3. Oct 2, 2026Post #303
  4. Oct 1, 2026В комментариях под прошлым постом нам бросили челлендж — и мы его решили принять! 👋 Если…
  5. Sep 30, 2026🎂 Нам два года! Друзья, сегодня Каналу влияния исполнилось два года. Мы до сих пор немног…
  6. Sep 29, 2026⏳ Сколько живут научные идеи? 12 октября объявят лауреатов Нобелевской премии по экономике…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →