TGViewer
Hopscotch analytics Hopscotch analytics @hopscotch_analytics · 168 subscribers
Post #23 345
Начал читать книжку Behavioral Data Analysis with R and Python. Заголовок заманчивый. Но в первой же главе автор начинает набрасывать:

A potential solution to the problem of confounders would be to add to the regression all the variables we can. This mindset of “everything and the kitchen sink” still has proponents among statisticians.

и там становится понятно, что эта книжка скорее про causal inference. Ок, я вполне уважаю эту предметную область, но как-то её адепты, по крайней мере у меня в linkedin, довольно агрессивно её насаждают: мол, эта ваша предиктивная аналитика бесполезна, когда речь заходит о поиске причинно-следственных связей.

И вот, значит, в этой первой главе автор приводит пример на синтетических данных, когда добавление фичей искажает выводы (позволю себе не описывать здесь этот пример, он довольно элементарный). Но делает это на примере линейной регрессии. Я вообще не знаю, в индустриальном дата саенсе кто-нибудь использует линейную регрессию всерьёз? Действительно, модель там тупит и даёт неверные выводы. Но если брать нормальный GBDT, то проблем с causal inference там нет никаких.

Да, я из этих самых "proponents among statisticians", которые наваливают фичей, чтоб борта датафреймов трещали (на первой итерации), и потом дальше с этим разбираются (include them all, God will recognize His own). Действительно, там могут случаться всякие наводки, когда фичи начинают фонить друг об друга. Они неплохо описаны тут у Лундберга, автора библиотеки shap. Но в этом и заключается часть задачи дата саентиста: устранить эти наводки (в частности, с помощью методов casual inference), а слепо доверять feature importance модели или shap values никто и не собирается. Более того, на практике ложные влияния часто становятся понятны на глаз (у меня был прикольный пример, когда сообщения пользователей в чатбот якобы влияли на отток, а потом оказалось, что в этих случаях сообщения были вида "помоги мне отписаться"). А вот если мы скормим мало фичей, то есть риск потерять скрытые факторы, влияющие на таргет, и тут уже ничего не попишешь.

Так вот, у меня к вам вопрос. Как вы подходите к causal inference? Например, вам надо определить, какие продуктовые фичи влияют на отток. Вы строите какую-то предиктивную модель и дальше детально разбираетесь с feature importance? Используете какие-то методы causal inference?

Ну и если есть кто-то, кто эту книгу уже читал, поделитесь впечатлениями. Стоит читать?
O’Reilly Online Learning Behavioral Data Analysis with R and Python Harness the full power of the behavioral data in your company by learning tools specifically designed for behavioral data analysis. Common data science algorithms and predictive... - Selection from Behavioral Data Analysis with R and Python [Book]
  • 🔥 4
  • ❤ 1
More from @hopscotch_analytics
  1. Sep 21, 2026Нашу заявку на доклад и воркшоп про retentioneering приняли на Quant UX Con 2026 🎉🎉🎉 Эт…
  2. Aug 19, 2026Вот как выглядит пользовательская траектория обычного человека 😢 https://x.com/aud_rud_wl…
  3. Jul 15, 2026Привет! В прошлом посте я писал о том, что делаю библиотечное решение. После этого мы пооб…
  4. Jun 19, 2026Я как-то подустал ходить по людям и демонстрировать платформенное решение Hopscotch, так ч…
  5. May 25, 202610 дней до DataFest в Белградском университете 😎 Спрос на 24.05 оказался даже выше, чем м…
  6. May 25, 2026Выступаю 31 мая на белградской площадке DataFest. Расскажу про графы переходов в аналитике…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →