Генеративные рекомендации II. По мотивам “Actions…”
Увидела актуальный список референсов для Generative Recommenders. Источник - препринт статьи от той же компании, что и оригинальный GR (Meta, признана экстремистской на территории РФ). Полный список: LiGR от LinkedIn, MTGR от Meituan, GenRank от Xiaohongshu, Argus от Yandex и UniGRF от Huawei и университетов Китая. Первые 4 подхода показали себя успешными в индустриальных А/Б тестах, последний проверялся только на публичных датасетах.
Как трансформируются в новых работах идеи GR?
Cхема Items-Actions Interleaving. “Actions…” предлагает схему обучения, где токены айтемов и действий чередуются, позволяя авторегрессионно решать одну из 2-х задач: Next-item или Next-action prediction. Все “наследники” кроме MTGR активно используют модальность действий (и некоторые добавляют контекст). LiGR и UniGRF сохраняют токены чередующимися и экспериментируют с объединением 2х задач в одной модели (хотя у LinkedIn не очень понятно, пошла ли объединённая модель в production). Argus и GenRank заменяют чередование токенов на суммаризацию эмбеддингов, чтобы оптимизировать compute. Argus - единственная модель, которая объединяет задачи, убирая interleave схему. Из интересного: Meta тоже отказывается от чередования токенов в последующих работах: Request-Only Optimization, Foundation–Expert Paradigm.
Отказ от impression-based семплов для ранжирующей модели . Авторы “Actions…” подчёркивают, что ранжирующая GR модель отличается от классических DLRM способом сборки обучающих семплов. Если DLRM с каждого показа пользователю айтема собирает один семпл для обучения с полным набором фичей, то GR группирует показы и историю пользователя в одну последовательность и предсказывает с такого семпла действия сразу для многих показанных айтемов. Все работы по мотивам “Actions…” следуют этому подходу, несмотря на отличающиеся архитектуры моделей. При этом индустриальные работы подчёркивают, что такой способ сборки обучения оптимизирует compute и способствует масштабированию моделей, а масштабирование в свою очередь растит качество.
“Target-aware cross attention in one pass” и адаптивная маска внимания. Оригинальная схема Items-Actions Interleaving позволяла авторам учить ранжирующую модель авторегрессионо и использовать target-aware attention (query нового айтема-кандидата смотрел по каузальной маске в прошлое - на keys и values всей истории пользователя до него). Обычно на инференсе такая схема означала бы необходимость в рантайме “подставлять” кандидатов в последовательность пользователя по одному и для каждого прогонять трансформер, чтобы получить предсказания (что долго). Авторы “Actions…” предлагают батчевый инференс для target-aware внимания: кандидаты подставляются в конец последовательности одновременно, и трансформер прогоняется один раз, при этом кандидаты благодаря адаптивной маске внимания никак не влияют друг на друга. За исключением Argus и LiGR, индустриальные “наследники” не используют авторегрессионное обучение ранжированию. Зато идея target-aware cross внимания в один проход используется не только для инференса, но и для обучения модели. GenRank, MTGR, а также 2 работы Meta описывают общий подход: группируем кандидатов для юзера за некоторый временной промежуток, ставим их в конец последовательности, корректно формируем маску внимания, чтобы они не влияли друг на друга - и учим модель предсказывать действия для каждого из них. Временным промежутком при этом может например быть один запрос рекомендаций, то что Meta называет “Request-Only Optimizations training and modeling paradigm”.
В целом, кажется, что GR из “Actions…” трансформируется либо в авторегрессионную архитектуру, совместно моделирующую и кандидато-генерацию, и ранжирование (как Argus, и возможно LiGR, а также непроверенный UniGRF). Либо становится Generative Ranking - чисто ранжирующей моделью c target-aware вниманием на пачку кандидатов “в один проход” (как MTGR, GenRank и новые работы Meta).
Post #11
2.29K