TGViewer
Убежище аналитика Убежище аналитика @shelter_analytics · 1.14K subscribers
Post #75 1.54K
🚨🚨🚨AI в Causal Inference - это хайп или полезный инструмент?

Всем привет!🤟

Сегодня наткнулся на новую статью Netflix про использование AI-агентов для Causal Inference.

В статье разбирается реальный кейс оценки влияния нового типа контента на удержание пользователей.

Сначала задачу просто отдают в клод, где наивная модель строит регрессию, получает красивую оценку эффекта и выдаёт результат, который оказывается завышенным на 75%.

Почему?

Потому что модель не учла проблему отбора: первые пользователи нового продукта отличаются от остальных пользователей. Они активнее, вовлечённее и чаще возвращаются в сервис независимо от самого продукта.

Netflix видит проблему не в самой модели. Проблема в том, что полученный результат никто не попытался критически проверить.

Надеюсь, что все будут согласны с тезисом:
Хорошее исследование — это не исследование, которое быстро выдаёт красивый результат, а исследование, которое прошло через несколько раундов критики и диагностических проверок.

Поэтому в их агентской архитектуре разделение исследовательских обязанностей сделано явно:

Есть Principal — человек, который формулирует исследовательский вопрос, описывает контекст и основные риски смещения.

Есть Actor — он читает написанный человеком план анализа и предлагает спецификацию: воздействие, результат, ковариаты и оцениваемые величины.
Детерминированный ноутбук выполняет эту спецификацию, используя doubly robust learner из EconML, оценивание через AIPW, проверки баланса ковариат и placebo-тесты. При этом LLM вообще не получает прямого доступа к данным.

Есть Critic — второй агент, анализирует статистические результаты, выявляет проваленные диагностики и предлагает улучшения.
Затем Actor обновляет спецификацию, после чего цикл повторяется.

Т.е. мы видим как генерация идей, стратегий передается на агентов, когда как вычисления проводятся в строгом детерминированном контуре (провалидированным человеком кодом).

Для оценки качества они используют данные соревнования ACIC 2016. Для каждого из 77 процессов генерации данных (DGP) случайным образом выбираются три датасета, в результате чего получается 231 задача для оценки качества алгоритма. Полученные оценки сравниваются с 44 методами-участниками конкурса ACIC. Они получают, что их методология конкурентоспособна по сравнению с этими эталонными показателями: она достигает достаточно низкого значения RMSE и хорошо откалиброванных доверительных интервалов, которые охватывают истину примерно в 95% случаев генерации данных.

Понятно, что речь идёт о синтетических данных и до полноценного использования таких систем в продакшене ещё далеко.

Тем не менее сама идея выглядит очень здраво: доверять агенту генерацию гипотез, спецификаций и интерпретацию результатов, а вычисления и статистические проверки оставлять детерминированному коду.

Для задач causal inference такой подход выглядит гораздо реалистичнее, чем попытка полностью заменить аналитика одной LLM.

Рекомендую ознакомиться с их постом.

P.s. также они публикуют в открытом доступе автономную версию oci-agentа.
  • 🔥 18
  • 🗿 5
  • ❤ 3
  • 👍 1
More from @shelter_analytics
  1. Sep 8, 2026Post #80
  2. Sep 4, 2026Post #79
  3. Sep 4, 2026Post #78
  4. Aug 17, 2026Post #77
  5. Aug 9, 2026Post #76
  6. May 23, 2026Убежище аналитика pinned «Привет! 🤟 Добро пожаловать в «Убежище аналитика». ❓Кто автор? М…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →