Генеративные рекомендации I. “Actions…”(2024)
Тема генеративных рекомендаций развивается на наших глазах - и поэтому не так просто её сходу систематизировать. Решила разложить по полочкам то, что выделяла для себя.
“Generative Recommender” (GR) из “Actions speak lourdes than words…”
Провокационная история - авторы очень красиво пишут, что их GR подход выучивает совместное распределение над последовательностями контента и действий пользователей с этим контентом - в схеме item-actions interleaving. И показывают на картинке, что в качестве следующего токена можно предсказывать, как следующий айтем, так и действие с ним. Проблема только одна - next-item и next-action задачи авторы не объединяют в одной модели и общего подхода к их действительно совместному использованию не предлагают.
Next-item задача при этом вырождается в (сильно) продвинутый SASRec с добавлением гетерогенных фичей (и негативных действий) в последовательность - и предсказанием только позитивных взаимодействий. А next-action задача прокачивает DLRM-модель с impression-level обучения (один показ айтема пользователю = один семпл для обучения модели) до “генеративного” обучения, где предсказания целевых действий происходят сразу по пачке показанных пользователю айтемов.
Вот только…
1. Формирование последовательностей из позитивных и негативных действий, добавление эмбеддингов на разные типы действий, авторегрессионное обучение и предсказание только позитивных действий - всё это было описано ещё в 2022 году в PinnerFormer. Новых идей тут немного - кроме самой схемы подачи токенов.
2. Ранжирующие модели над последовательностями позитивных и негативных действий, с эмбеддингами типов действий, ранним связыванием и т.п., тоже уже были - те самые DLRM, которым GR противопоставляется (например TransAct). “Генеративность” ранжирующей GR-модели авторы описывают самой постановкой обучения - “generative training”. Они предлагают делать один проход модели с каузальной маской над историей, а также с ранним связыванием сразу на батч айтемов, действия с которыми надо предсказать (“target-aware cross attention in causal-masked settings… in one pass”). И в большей степени такая постановка меняет способ создания выборки для обучения и сам процесс обучения, чем цель применения ранжирующей модели.
3. А что HSTU? По факту это просто ещё одна архитектура трансформера, которая напрямую не связана с генеративными рекомендациями. Кроме клейма авторов, что она достаточно экспрессивна для того, чтобы модель на её основе могла обходиться без вручную сгенерированных фичей-счётчиков. Но это далеко не единственный способ решения проблемы (есть например LiGR). На публичных бенчмарках авторы статьи показывали именно результаты HSTU архитектуры в классической "Shifted Sequence" постановке обучения, без схемы с использованием actions - что не совсем очевидно при беглом прочтении.
И тем не менее, “Actions…” - статья невероятно влиятельная, hands down. Авторы предложили общее идеологическое видение того, куда можно двигаться дальше. Самый “прямой” наследник идей на основе item-actions-interleaving, мне кажется, Argus, в котором сделали следующий шаг - и соединили таки задачи next-item и next-action в одной модели (помимо множества других нововведений и последующего перехода к генерации сессий). Но эту историю вы и так знаете.
Post #9
3.09K