💬 Как делать причинные выводы, если ваши данные — это текст?
Жалобы, интервью, посты, открытые ответы в анкетах — всё это тексты, которые всё чаще становятся объектом анализа в социальных науках (Gentzkow et al., 2019)
📝 Тексты могут играть разные роли в моделях, оценивающих причинно-следственные связи (Feder et al., 2022):
🟤Воздействие (treatment): как формулировка влияет на поведение?
🟤Исход (outcome): как воздействие повлияло на текст? (результат интервенции — это тон, содержание или тема высказывания)
🟤Общая причина (confounder): текст влияет и на воздействие, и на исход
Недавно мы писали о подходе к оценке эффектов воздействия на качественных данных, а как оценить эффект воздействия, если переменная — это текст, а не число?
📍Извлечение переменных из текста и смещение выводов
Авторы работы (Egami et al., 2022) считают, что ключевая проблема идентификации, которая возникает, когда текст нужно агрегировать в интерпретируемую переменную (например, "наличие темы", "эмоциональный тон") — это фундаментальная проблема причинного вывода при наличии скрытых переменных (Fundamental Problem of Causal Inference with Latent Variables)
Если вы извлекли интерпретируемую переменную из текста на тех же данных, где оцениваете её эффект, то:
🟤возникает переобучение
🟤результат зависит от конкретной рандомизации
🟤нарушается условие условной независимости (ignorability)
Чтобы получить валидные оценки, авторы предлагают разделение выборки (sample splitting):
🟤На обучающей выборке (train) извлекать некоторую функцию кодирования текста g (например, topic model)
🟤На тестовой выборке (test) — применить g, оценить эффект (например, разность средних, регрессию)
📍Как реализовать оценку на практике?
В свежей работе (Modarressi et al., 2025) авторы реализуют идеи (Egami et al., 2022) в полноценном алгоритме, когда исход представлен в форме текста
Алгоритм оценки включает три шага:
🟤Тест на наличие эффекта (reverse prediction): можно ли по тексту определить, к тестовой группе или контрольной он относится?
🟤Выделение причинных тем (causal themes): LLM предлагает интерпретируемые шкалы различий между группами (например, «упоминание причинной идентификации»). Темы валидируются экспертами (человеческая разметка) на независимой подвыборке
🟤Оценка полноты (completeness): насколько хорошо эти темы объясняют разницу между группами (аналог коэффициента детерминации)
📍А что, так уже делают? А что? А где?
В недавней статье в Nature исследователи используют причинную модель на текстовых данных и показывают, что негативно окрашенные слова в заголовке новости на 2,3% увеличивали число кликов по ней (Robertson et al., 2023)
А какие посты чаще читаете вы? С положительными словами в заголовке или отрицательными?
#канал_обозревает
@causal_channel
Post #339
1.01K
Forwarded from Канал влияния
- 👍 9
- 🔥 3
- 🤩 2