Как научить рекомендательную систему думать не о следующем лайке, а обо всей сессии?
В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание.
Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот.
AI VK Research попробовали решить эту задачу через Reinforcement Learning.
Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward.
Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник:
https://habr.com/ru/companies/vk/articles/1068050/
#AI #Recsys #MachineLearning #RL
Post #2932
3.22K

- 👍 6
- 🤣 5
- ❤ 2
- 🔥 2