TGViewer
AI VK Hub AI VK Hub @aihubvk · 2.49K subscribers
Post #565 1.73K
Несмотря на взрывной рост рекомендательных трансформеров, генеративных рекомендаций и так далее, классические методы на основе матричных факторизаций всё ещё применяются в рекомендательных системах.

Преимущество современных подходов в том, что они позволяют работать с пользователем в долгосрочной перспективе и учитывать её при построении рекомендаций. Так делают, например, PinnerFormer, OneRec. При этом матричные факторизации обычно работают жадно: набираем top-K по похожести между эмбеддингами в данный момент времени.

Исследователи AI VK Михаил Трапезников и Максим Утушкин предложили подход, который снимает это ограничение и позволяет рекомендательным системам учитывать будущие изменения состояния пользователя.

Решение подробно изложено в статье Planning over Matrix-Factorization MDPs for Candidate Generation. Статья принята на воркшоп по Customer Journey на KDD 2026.

Подход

Исследователи работали с популярной моделью матричных факторизаций ALS (Alternating Least Squares), ориентируясь на механику обновления профилей в сервисе Profile Stream в VK. В нём эмбеддинг пользователя не просто фиксируется после обучения, а обновляется по явной формуле после каждого батча новых пользовательских взаимодействий.

Исследователи применили технику MCTS (Monte Carlo Tree Search) — представили возможные последовательности рекомендаций в виде дерева, чтобы найти путь в дереве, соответствующий оптимальной последовательности рекомендаций. Для офлайн-экспериментов при построении дерева рассматривались набор действий из top-K по близости эмбеддингов и оптимистичная среда.

Вершина дерева — текущее состояние, ветви из вершины — k возможных рекомендаций. При переходе по ветви считаем, что пользователю понравилась рекомендация (оптимистичный сценарий), попадаем в новое состояние — и там всё повторяется.

Процесс

Можно представить процесс в виде RL-среды:

🔸 Состояние — текущее эмбеддинговое представление пользователя
🔸 Действие — показ айтема пользователю
🔸 Награда — сумма близостей к понравившимся айтемам
🔸 Обновление состояния происходит согласно формулам обновления в ALS

Такое представление открывает возможность применения различных RL-подходов, которые позволяют не просто работать с сиюминутными наградами, но и планировать на несколько шагов вперёд.

В работе рассматривались датасеты MovieLens-1M, KuaiRec, Yambda и VK-LSVD. Сравнения производились под протоколами Leave-last-n и Global time split. Первый откладывает последние взаимодействия каждого пользователя, второй режет данные по глобальной временной отсечке — это ближе к проду.

Результат

➡️ На Leave-last-n планирование обходит обычный статический top-K на всех датасетах. В частности, на срезах VK-LSVD Recall@10 растёт примерно в полтора раза
➡️ На Global time split выигрыш сохраняется на MovieLens-1M и VK-LSVD

Главное, что доказало исследование — использование обучения с подкреплением поверх относительно легковесной ALS возможно. В дальнейшем планируются исследования стохастической динамики среды из логов и дистилляции агента в быструю политику в духе MuZero.

#aivkhub #rl #mcts #als
  • 👍 9
  • 🔥 9
  • ❤ 7
  • 😁 2
  • 💅 1
More from @aihubvk
  1. Sep 18, 2026Post #624
  2. Sep 17, 2026Вакансии для тех, кто хочет развивать рекомендательные системы и работать с большими модел…
  3. Sep 15, 2026Post #622
  4. Sep 11, 2026📱 Рекомендательные системы видео, клипов и постов работали раньше независимо: сигналы от…
  5. Sep 10, 2026Alignment: от ручной разметки к проверяемым наградам За аббревиатурами SFT, RLHF, PPO и GR…
  6. Sep 8, 2026На прошедших выходных прошла вторая встреча AI VK & Pro — место, где лиды ML и RecSys из б…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →