TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4745 2.7K
База про Causal AI: сначала граф, потом эффект (Рубрика #RnD)

Посмотрел короткий доклад Вадима Порватова из Сбера «Проблемы и перспективы Causal AI» с Data Fest 2026. Это хороший пятнадцатиминутный маршрут по теме, которую часто сводят к фразе «корреляция не означает причинность». Главный тезис здесь практичнее: прежде чем оценивать эффект действия, нужно восстановить хотя бы правдоподобную структуру причин.

Вадим начинает с трёх уровней аналитики
- Описательная отвечает на вопрос, что произошло
- Предсказательная дает ответ о том, что произойдёт
- Каузальная подсказывает, а что нужно изменить, чтобы получить нужный результат

Золотой стандарт для последней - рандомизированный эксперимент или a/b тест. Кстати, по a/b тестам рекомендую книгу "Доверительное a/b тестирование (Trustworthy Online Controlled Experiments)", о которой я уже рассказывал. Но такие тесты могут быть дорогими, долгими, неэтичными или физически невозможными. Тогда приходится работать с наблюдаемыми данными и явно записывать допущения.

Дальше доклад пробегает почти всю карту causal discovery:

- От Фишера с рандомизированными экспериментами к potential outcomes Рубина и structural causal models Джудеи Перла;
- Два этапа causal inference: сначала identification - какой причинный граф допустим, затем estimation - каков эффект вмешательства;
- Два классических семейства поиска структуры: constraint-based и score-based; на входе таблица данных плюс экспертные ограничения на наличие и направление связей;
- Допущения об ацикличности, Markov property и faithfulness, а главное - causal sufficiency: все ли общие причины измерены. Именно скрытый confounder способен превратить сильную корреляцию в ложную историю про эффект;
- Алгоритмы PC/SGS и семейство FCI. FCI не просто ориентирует рёбра, а отмечает места, где связь может объясняться скрытой переменной; FCI-stable, RFCI и FCI+ улучшают устойчивость, скорость или работу с разреженными графами. Более новые методы пытаются уже восстанавливать структуру latent variables.

Отдельный холодный душ - LLM. По приведённой Вадимом работе, модели без специальной настройки плохо решают causal discovery, а fine-tuning даёт хрупкий выигрыш: небольшой сдвиг данных ломает результат. Для сценарного моделирования LLM нужен внешний causal grounding, а не уверенный текст о том, «что на что влияет».

В финале Вадим показывает CAIMAN - разрабатываемую в Сбере библиотеку с оптимизированными вариантами PC/FCI, bootstrap-оценкой неопределённости и будущим переносом вычислений на GPU. По словам автора, код планируется опубликовать; публичного репозитория на момент проверки я не нашёл.

P.S.

Вообще, я в эту тему погрузился когда-то, когда разбирался с современной моделью DORA - её ежегодные исследования тоже начинаются с опросов, то есть с наблюдательных, а не экспериментальных данных.
- В ранней методологии DORA использовала теоретические гипотезы, латентные конструкты, факторный анализ и PLS-SEM (про это говорит документ 2021 года)
- В отчёте 2024 года подход сформулирован ещё ближе к докладу: исследователи задают DAG, решают, какие факторы учитывать, а затем байесовски оценивают направление, величину и неопределённость эффектов.

Но статистика не превращает ответы респондентов в причинность по щелчку. Вывод остаётся условным относительно выбранного графа, качества вопросов и учтённых confounders. И тут мы видим прямую связку с докладом: самая важная часть causal inference происходит до расчёта коэффициентов - когда мы решаем, какие переменные существуют и почему между ними вообще должна быть стрелка.

#AI #Data #MachineLearning #CausalInference #Research #DORA
YouTube Вадим Порватов | Проблемы и перспективы Causal AI Спикер: Вадим Порватов, Сбер, DS Team Lead Data Fest 2026: https://ods.ai/events/datafest2026 Презентацию к докладу Вы можете скачать в треке секции Reliable ML ______ Наши соц.сети: Telegram: https://t.me/datafest Вконтакте: https://vk.com/datafest…
  • ❤ 3
  • 👍 2
  • 🔥 2
More from @book_cube
  1. Oct 4, 2026Один дизайнер и сотни материалов (Рубрика #AI) В этом видео «One Designer + AI. Hundreds o…
  2. Oct 4, 20263 AImigo S1E8: AI-native компания — материалы выпуска (Рубрика #AI4SDLC) Собрал материалы…
  3. Oct 4, 2026В процессе подготовки к переезду начал разбирать книжки и освобождать свою библиотеку. Нат…
  4. Oct 4, 2026Stanford CME295, лекция 1: как текст становится вычислениями (Рубрика #AI) Первая лекция к…
  5. Oct 3, 2026Камил видит руками (Рубрика #ForKids) Читаю своему пятилетнему сыну Кириллу перед сном эту…
  6. Oct 3, 2026Где деньги в своих данных: цены, клиенты, ассортимент — материалы второго выпуска (Рубрика…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →