Deep RecSys Course X.
Начинаем серию из двух занятий про обучение с подкреплением!
На лекции:
1. Закончили тему графовых моделей - обсудили unsupervised graph learning, модели от Twitter и TikTok.
2. Обсудили задачу RL бандитов - что такое feedback loop и зачем нужен exploration, формализацию бандитной задачи, простые алгоритмы ее решения.
На семинаре обсуждали использование бандитных алгоритмов в Ютубе:
1. Разобрали статью про кандген — Online Matching: A Real-time Bandit System for Large-scale Recommendations
2. Немного затронули ранжирование — Long-Term Value of Exploration: Measurements, Findings and Algorithms
YouTube | Github
P.S: эту легендарную картинку со странички лабы Microsoft Research SV можно увидеть в большей части лекций и докладов про бандитов :)
Post #402
4.25K

- 🔥 37
- ❤ 5
- ❤🔥 4
- 🥰 1