TGViewer
Асимптотически нормальный канал Асимптотически нормальный канал @asymptotically_normal · 697 subscribers
Post #54 1.42K
Зачем нужны вероятностные модели, если есть бустинг?

Вчера провел первую лекцию своего курса по статам в ШАД, которая практически полностью повторяет недавно выложенную лекцию про распределения в реальной жизни со студкемпа. Помимо прочего подняли вопрос, чем моделирование в духе Buy Till You Die лучше старого доброго бустинга в оценке LTV пользователя.

Привожу ответ моего студента Дани Ануфриева, который ведет практику на этом курсе, а вообще по жизни занимается разработкой крутых методов моделирования поведения пользователей в Озоне.

1️⃣ С помощью моделей типа BTYD можно почти забесплатно ответить сразу на большой список вопросов:
‣ с какой вероятностью пользователь еще активен? в каком состоянии находится?
‣ через какое время ожидаемо вернется?
‣ какое ожидаемое LTV на 30, 60, 365 дней? Или может даже какое дисконтированное LTV на бесконечности?
Причем ответы на эти вопросы выражаются часто в виде вполне понятных интерпретируемых формул от достаточных статистик пользователей.

В случае бустингов пришлось бы для каждого из таких вопросов обучать отдельный black-box и смотреть, что получается, не очень понимая при этом как они все друг с другом соотносятся.

Если же один раз серьезно подойти к вопросу о там, как устроен процесс поведения пользователей, то на каждый подобный запрос можно иметь под рукой хотя бы такой бейзлайн.

2️⃣ Если же у вас есть конкретная предсказательная задача (что на самом деле не так часто встречается) и «бустинг делает бррр», то артефакты BTYD или других вероятностных моделей можно использовать в качестве фичей: предсказания (не только вашего таргета, но и всего на свете, на что моделька может дать ответ), интервалы, правдоподобия, достаточные статистики и т.д. В случае поведения пользователей есть 100000000000 способов вытащить таким образом какие-нибудь нетривиальные фичи.

Кроме того, обучение и анализ вероятностных моделей может навести на правильные мысли и вообще дать полезную интуицию про физику вашего процесса.

3️⃣ Ну и наконец даже простые вероятностные модельки могут помочь решать очень разные вопросы, связанные c:
‣ пропусками в данных,
‣ нормировками для точек обучающего датасета,
‣ новыми каналами пользователей, которые уже обученный бустинг не описывает, а данных для обучения (LTV365, например) еще нет.

🔣 Вообще предсказание всяких таких поведенческих штук дело очень обреченное — не будет там мега-хороших метрик/скоров. У нас всегда будет очень много неопределенности в предсказании. И тут важно вообще понимать масштабы проблемы и какого мы вообще результата в предсказании теоретически можем добиться. В этом месте можно обратиться тоже, например, к вероятностным моделькам, чтобы посмотреть какие там достигаются теоретические границы в наших метриках качества.
  • ❤‍🔥 13
  • ❤ 9
  • 🔥 1
More from @asymptotically_normal
  1. Aug 5, 2026Post #71
  2. Aug 4, 2026Post #69
  3. Aug 1, 2026Post #68
  4. Jul 19, 2026Post #67
  5. Jun 14, 2026170 лет со дня рождения Маркова-старшего! Совсем недавно, кстати, была первая годовщина со…
  6. Apr 17, 2026Текстовые квесты как инструмент оценки долговременной памяти языковых моделей Аня Казанцев…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →