Успешные внедрения LLM-based кандидато-генерации. Google и Kuaishou.
Следующая хайповая RecSys тема после end-2-end генеративных моделей - это LLM-based рекомендательные движки. Недавно появились сразу 3 статьи от топовых игроков с успешными результатами в A/B от внедрения дообученных LLM: OneRec-Think от Kuaishou, PLUM от Google (внедрение в Youtube) и "Large Scale Retrieval…" от LinkedIn. И до этого в июле был тех репорт RecGPT от AliBaba.
Я не буду разбирать подробно каждую статью и зарываться в технику. Интересно именно выделять общие тенденции, чтобы понимать, куда движется индустрия. Начнём с Google и Kuaishou.
Общее в подходах:
1. Старт с предобученной LLM. Google берёт Gemini-1.5-MoE-900M. Kuaishou Qwen-8B.
2. Семантические ID для айтемов (SIDs). Обе компании используют семантические ID как главное представление айтемов для модели. Для построения SIDs в обоих случаях используют как мульти-модальные контентные эмбеддинги айтемов, так и коллаборативный сигнал из сервиса. Cервис в обоих случаях - видео платформа.
3. Алайнмент семантических ID и языковых токенов на этапе претрейна. Словарь LLM расширяется, чтобы включать себя каталог семантических ID айтемов. Для того, чтобы новые токены обрели свой смысл в исходном семантическом пространстве LLM, модель дообучается на задаче Next Token Prediction на текстах, описывающих как поведение действий пользователей, так и сам каталог сервиса. "Поведенческие" тексты интегрируют SIDs в текстовое описание действий пользователя. Пример: "Пользователь <с такими фичами> лайкнул видео <SID-1><SID-2><SID-3> с заголовком <заголовок> и видео … с заголовком …". Помимо "поведенческих" примеров претрейн модели у обеих компаний включает в себя задачу предсказания текстового описания айтема на основе его SIDs.
4. На некотором этапе (Kuauishou во второй стадии претрейна, Google в файнтюне) модель обучают предсказывать семантические ID айтема, который стоит порекомендовать пользователю на основе истории его действий. Это уже полностью отвечает той задаче, которую решают современные рекомендательные трансформеры над пользовательскими историями, и тут дообученная LLM полностью их заменяет. Инференс аналогичен TIGER - последовательная генерация SIDs, beam search.
Подходы настолько похожи, что формируется некоторое общее очертание рабочего рецепта.
Отличия в подходах:
1. Kuaishou весь файнтюн посвящает ризонингу. Модель учат формулировать обоснование, почему пользователь после заданной истории взаимодействовал с конкретным айтемом. Генерация обоснований нужна для улучшения качества самих рекомендаций, по аналогии с рассуждающими LLM.
2. Kuaishou внедряет модель в оффлайне как раз из-за вычислительной сложности ризонинга. Рассуждающая модель в оффлайне генерирует несколько возможных траекторий (reasoning path) пользователя, и для каждой траектории - несколько возможных префиксов из 2-х SIDs. Финальный сет всех возможных префиксов затем используется рантаймовой OneRec моделью для генерации итоговых рекомендаций. Поскольку OneRec является end-2-end движком, стадии ранжирования дальше не следует, генерируются именно финальные рекомендации.
3. Google на этапе файнтюна учит именно предсказание будущих айтемов для пользователя, учитывает рантаймовый контекст в промте. Пишут, что модель внедрили и в оффлайне, и в рантайме.
Заметки на полях:
- Количество dense параметров в трансформере у PLUM в 100 раз больше, чем у продового трансформера Youtube над пользовательской историей.
- Kuaishou на примере доказывает полезность модели в сценарии диалога с пользователем. Здесь уже намечается персонализированный ассистент по рекомендациям, но пока о внедрении речи нет.
- Google (как и LinkedIn) подчёркивает, что подобные архитектуры можно использовать для различных даунстрим задач, не только для кандидато-генерации.
- Более подробный разбор PLUM есть у Кирилла.
Post #23
2.25K
- 👍 12
- 🔥 7
- ❤ 4