A potential solution to the problem of confounders would be to add to the regression all the variables we can. This mindset of “everything and the kitchen sink” still has proponents among statisticians.
и там становится понятно, что эта книжка скорее про causal inference. Ок, я вполне уважаю эту предметную область, но как-то её адепты, по крайней мере у меня в linkedin, довольно агрессивно её насаждают: мол, эта ваша предиктивная аналитика бесполезна, когда речь заходит о поиске причинно-следственных связей.
И вот, значит, в этой первой главе автор приводит пример на синтетических данных, когда добавление фичей искажает выводы (позволю себе не описывать здесь этот пример, он довольно элементарный). Но делает это на примере линейной регрессии. Я вообще не знаю, в индустриальном дата саенсе кто-нибудь использует линейную регрессию всерьёз? Действительно, модель там тупит и даёт неверные выводы. Но если брать нормальный GBDT, то проблем с causal inference там нет никаких.
Да, я из этих самых "proponents among statisticians", которые наваливают фичей, чтоб борта датафреймов трещали (на первой итерации), и потом дальше с этим разбираются (include them all, God will recognize His own). Действительно, там могут случаться всякие наводки, когда фичи начинают фонить друг об друга. Они неплохо описаны тут у Лундберга, автора библиотеки shap. Но в этом и заключается часть задачи дата саентиста: устранить эти наводки (в частности, с помощью методов casual inference), а слепо доверять feature importance модели или shap values никто и не собирается. Более того, на практике ложные влияния часто становятся понятны на глаз (у меня был прикольный пример, когда сообщения пользователей в чатбот якобы влияли на отток, а потом оказалось, что в этих случаях сообщения были вида "помоги мне отписаться"). А вот если мы скормим мало фичей, то есть риск потерять скрытые факторы, влияющие на таргет, и тут уже ничего не попишешь.
Так вот, у меня к вам вопрос. Как вы подходите к causal inference? Например, вам надо определить, какие продуктовые фичи влияют на отток. Вы строите какую-то предиктивную модель и дальше детально разбираетесь с feature importance? Используете какие-то методы causal inference?
Ну и если есть кто-то, кто эту книгу уже читал, поделитесь впечатлениями. Стоит читать?