А у нас вышло новое, одиннадцатое занятие Deep Recsys курса. Оно, конечно, не про разговорные рекомендации, но тоже тема интересная!
На лекции:
1. Сделали переход от next item prediction к RL
2. Обсудили алгоритм REINFORCE: рассмотрели all-actions и reward-to-go версии, вывели оптимальный baseline, сделали off-policy correction
На семинаре разобрали статью Top-K Off-Policy Correction for a REINFORCE Recommender System про применение REINFORCE в Youtube.
YouTube | Github
P.S: курс постепенно подходит к концу. Осталось три занятия — одна гостевая лекция и
