🚨🚨🚨AI в Causal Inference - это хайп или полезный инструмент?
Всем привет!🤟
Сегодня наткнулся на новую статью Netflix про использование AI-агентов для Causal Inference.
В статье разбирается реальный кейс оценки влияния нового типа контента на удержание пользователей.
Сначала задачу просто отдают в клод, где наивная модель строит регрессию, получает красивую оценку эффекта и выдаёт результат, который оказывается завышенным на 75%.
Почему?
Потому что модель не учла проблему отбора: первые пользователи нового продукта отличаются от остальных пользователей. Они активнее, вовлечённее и чаще возвращаются в сервис независимо от самого продукта.
Netflix видит проблему не в самой модели. Проблема в том, что полученный результат никто не попытался критически проверить.
Надеюсь, что все будут согласны с тезисом:
Хорошее исследование — это не исследование, которое быстро выдаёт красивый результат, а исследование, которое прошло через несколько раундов критики и диагностических проверок.
Поэтому в их агентской архитектуре разделение исследовательских обязанностей сделано явно:
Есть
Principal — человек, который формулирует исследовательский вопрос, описывает контекст и основные риски смещения.
Есть
Actor — он читает написанный человеком план анализа и предлагает спецификацию: воздействие, результат, ковариаты и оцениваемые величины.
Детерминированный ноутбук выполняет эту спецификацию, используя doubly robust learner из EconML, оценивание через AIPW, проверки баланса ковариат и placebo-тесты. При этом LLM вообще не получает прямого доступа к данным.
Есть
Critic — второй агент, анализирует статистические результаты, выявляет проваленные диагностики и предлагает улучшения.
Затем Actor обновляет спецификацию, после чего цикл повторяется.
Т.е. мы видим как генерация идей, стратегий передается на агентов, когда как вычисления проводятся в строгом детерминированном контуре (провалидированным человеком кодом).
Для оценки качества они используют данные соревнования ACIC 2016. Для каждого из 77 процессов генерации данных (DGP) случайным образом выбираются три датасета, в результате чего получается 231 задача для оценки качества алгоритма. Полученные оценки сравниваются с 44 методами-участниками конкурса ACIC. Они получают, что их методология конкурентоспособна по сравнению с этими эталонными показателями: она достигает достаточно низкого значения RMSE и хорошо откалиброванных доверительных интервалов, которые охватывают истину примерно в 95% случаев генерации данных.
Понятно, что речь идёт о синтетических данных и до полноценного использования таких систем в продакшене ещё далеко.
Тем не менее сама идея выглядит очень здраво: доверять агенту генерацию гипотез, спецификаций и интерпретацию результатов, а вычисления и статистические проверки оставлять детерминированному коду.
Для задач causal inference такой подход выглядит гораздо реалистичнее, чем попытка полностью заменить аналитика одной LLM.
Рекомендую ознакомиться с их
постом.
P.s. также они публикуют в открытом доступе автономную версию
oci-agentа.