TGViewer
AI VK Hub AI VK Hub @aihubvk · 2.49K subscribers
Post #471 3.26K
🔁 Generative retrieval с коллаборативными Semantic ID: как обновлять токены без полного переобучения

Владимир Байкалов, ведущий исследователь в AI VK и коллеги из ИТМО выяснили, что наивное обновление Semantic ID в generative retrieval может ухудшить качество рекомендаций — и предложили способ это исправить. Статья принята в SIGIR '26.

1️⃣ Контекст

Двустадийные GR-системы — в том числе OneRec и PLUM — работают так: сначала обучается токенизатор, который строит дискретные идентификаторы (Semantic ID) для каждого айтема по контентным признакам и коллаборативному сигналу из логов. Затем retriever учится генерировать эти идентификаторы по истории пользователя.

Коллаборативный сигнал дрейфует: меняются интересы пользователей, популярность айтемов, структура взаимодействий. Нужно периодически пересчитывать SID на свежих логах. Но пересчёт порождает новые токены, несовместимые с выученным выходным пространством ретривера.

Инженер оказывается перед выбором из двух плохих опций. Или оставить устаревшие SID и дообучать retriever на новых данных, но тогда коллаборативная семантика отстаёт от реального поведения. Или пересобрать SID и переобучить retriever с нуля, но это затратно по ресурсам.

Авторы предложили выравнивать SID и показали, что такой подход лучше существующих опций. Сравнение проводилось на примере 3 датасетов: Amazon Beauty, VK-LSVD и Yambda.

2️⃣ Решение

Предложенный подход выравнивает новые токены под старое пространство перед дообучением retrieval модели.

Для каждой позиции кодбука на пересечении айтемов из старой и новой токенизации строится матрица совстречаемости. По ней решается задача биективного матчинга с помощью жадного или венгерского алгоритма. Обновлённые SID отражают свежую коллаборативную структуру и совместимы с существующим чекпоинтом, поэтому retriever может быть дообучен на них с уменьшением дрейфа коллаборативного сигнала.

3️⃣ Результаты

Без выравнивания пересчёт SID на новых логах работает нестабильно. Retriever вынужден одновременно адаптироваться к новым данным и переучивать маппинг между старым и новым пространством токенов. После выравнивания метрики на новых логах устойчиво растут, а вычислительные затраты сокращаются.

В эксперименте с тремя последовательными обновлениями подход с сохранением устаревших SID деградирует с каждым шагом, в то время как обновление с выравниванием держится на уровне полного переобучения.

Открытым остаётся вопрос динамического расширения словаря: как поведёт себя метод, когда в новых логах появляются айтемы, которых не было в старом кодбуке.

#обзорстатьи #AIVKResearch
  • ❤ 18
  • 🔥 11
  • 👍 4
  • 🎉 2
  • 👏 1
More from @aihubvk
  1. Sep 23, 2026Кеш кандидатов: как рекомендеры VK тратят меньше железа Каждый запрос к рекомендеру стоит…
  2. Sep 22, 2026Post #627
  3. Sep 22, 2026🎬 Делимся репортажем с недавно прошедшего мероприятия AI VK & Pro. #AIVK #aivkhub #recsys…
  4. Sep 21, 2026Post #625
  5. Sep 18, 2026Post #624
  6. Sep 17, 2026Вакансии для тех, кто хочет развивать рекомендательные системы и работать с большими модел…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →