Представьте ситуацию: 146 исследовательских команд получают одинаковые данные и одинаковую задачу по оценке эффекта воздействия. Казалось бы, если все работают с одними и теми же данными, результаты должны быть примерно одинаковыми. На практике же разброс оценок оказывается огромным!
📊 Невоспроизводимость результатов исследований - одна из ключевых проблем современной прикладной эконометрики, мы уже писали об этом ранее. Это связано с:
🟤репликационным кризисом – значительное количество экономических и экспериментальных исследований не удается воспроизвести (Camerer et al., 2016)
🟤публикационными искажениями – исследования с значимыми результатами публикуются чаще, чем исследования с "нулевыми" результатами (Brodeur et al., 2020)
🟤гибкостью исследовательских решений – исследователи делают множество субъективных выборов на каждом этапе работы с данными, что влияет на конечный результат (Simmons et al., 2011)
Новое исследование "The Sources of Researcher Variation in Economics" с немыслимыми для социальных наук 150 (!) соавторами иллюстрирует, почему даже при соблюдении общепринятых подходов экономисты приходят к разным выводам
😥 Дизайн эксперимента
Авторы используют many-analysts design. Они предложили 146 командам выполнить одну и ту же задачу в три этапа, постепенно снижая степень свободы испытуемых. Это позволило оценить, какие решения в исследовательском процессе приводят к наибольшей вариативности оценок
1️⃣ Первая стадия: исследователь самостоятельно принимает все решения
🟤Участники получают одинаковые исходные данные, никаких других ограничений не вводится
🟤Исследователи выбирают всё: как формировать выборку (контрольную группу и группу воздействия), как предварительно обрабатывать данные (удалять пропуски, кодировать переменные, исключать выбросы и т. д.), какие переменные включать в анализ, какую эмпирическую стратегию использовать (метод оценки, расчет стандартных ошибок, использование весов для выборки)
2️⃣ Вторая стадия: исследователь может выбрать подход к обработке данных и метод оценки
🟤Организаторы вводят четкие правила формирования выборки: определены критерии группы воздействия и контрольной группы, а также установлены временные рамки для анализа
🟤Предварительная обработка данных, выбор контрольных переменных и выбор методологии остаются на усмотрение исследователей
3️⃣ Третья стадия: исследователь может выбрать только метод оценки
🟤Все исследователи работают с уже предварительно очищенной базой данных, подготовленной организаторами = одинаковая выборка + одинаковые переменные + отсутствие расхождений в предварительной обработке данных
🟤Исследователи могли выбирать только эмпирическую стратегию оценки
🤔 Ключевые результаты
🟤Исследователи приходили к разным выводам, даже работая с одной базой данных
🟤Самая большая вариативность возникала на этапе предварительной обработки данных. На 1-й стадии исследователи выбирали разные подходы к формированию выборки, из-за чего медианное количество наблюдений различалось в 10 раз! На 3-й стадии, где выборка была стандартизирована, разброс стал нулевым
🟤Когда процесс стандартизировали, расхождения уменьшались, но не исчезали: на 1-ой стадии (полная свобода) межквартильный размах (IQR) составил 3.1 п.п., на 2-ой стадий (фиксированный дизайн) IQR был равен 4 п.п., на 3-ей (фиксированные данные) IQR 2.4 п.п.
❗️ Почему это важно?
🟤Обработка данных – главный источник вариативности результатов, поэтому так важно подробно описывать и публиковать весь процесс работы с данными
🟤Четкие методологические инструкции не гарантируют одинаковых результатов. Даже когда исследователи используют одни и те же модели, субъективные решения сильно влияют на выводы
🟤Прозрачность формирования выборки не менее важна, чем выбор модели. Научное сообщество уделяет много внимания статистическим методам, но редко обсуждает стандартизацию предварительной обработки данных
#канал_обозревает
@causal_channel

