TGViewer
AI VK Hub AI VK Hub @aihubvk · 2.49K subscribers
Post #586 953
Expressiveness-Efficiency Trade-off: длина кода SID против стоимости генерации

В авторегрессивных декодерах каждый дополнительный токен Semantic ID (SID) требует отдельного шага генерации. Чем длиннее код, тем точнее он различает айтемы, но и тем выше задержка. Это третья из фундаментальных проблем генеративных рекомендаций.

Часть 1
Часть 2
Часть 3

Стороны компромисса

Кодовое пространство SID содержит K ** L кодов, где K — размер кодбука, а L — число уровней. Длинные SID уменьшают коллизии и лучше различают тонкие атрибуты, позволяя эффективнее использовать сильные энкодеры. В экспериментах RPG увеличение длины с 4 до 16–64 токенов примерно удвоило NDCG@10.

С другой стороны, так как декодер генерирует SID токен за токеном, то число прямых проходов пропорционально произведению ширины beam на длину SID. Например, TIGER ограничивается 4 уровнями с кодбуком 256, и при длине SID 32 и более beam search становится неприемлемым. Короткие SID порождают обратную проблему: рост коллизий и усложнение разрешения айтема.

Проблема в архитектуре, а не в длине

Ключевой вывод: компромисс верен для TIGER-подобных архитектур, но не фундаментален. Его причина в последовательной зависимости residual quantization и авторегрессивного декодирования.

RQ квантует остатки последовательно: каждый токен уточняет предыдущий, создавая иерархию от грубых категорий к тонким атрибутам, но требуя L шагов декодера. Авторегрессивный декодер усиливает это ограничение: каждый шаг зависит от предыдущего, ошибки накапливаются, а beam search умножает стоимость на ширину поиска.

Подходы к решению проблемы

1️⃣Параллельная генерация длинных SID

RPG заменяет residual quantization на Optimized Product Quantization: токены независимы, так как каждый кодирует ортогональное подпространство эмбеддинга. Модель предсказывает все токены одновременно через multi-token prediction.

Поиск валидных SID ведётся через граф семантически близких кодов, сложность которого не зависит от числа айтемов. Это позволяет использовать SID длиной до 64 токенов без пропорционального роста задержки.

2️⃣Адаптивное сжатие длинного кода

Например, ACERec сохраняет длинный 32-токенный SID, но до подачи в последовательную модель сжимает его через cross-attention в малое число латентных токенов. Декодер работает на компактном представлении, а скоринг сводится к параллельному вычислению логитов по кодбукам и суммированию для каждого айтема.

Таким образом, стоимость определяется числом латентных токенов, а не длиной SID.

3️⃣Кластерные SID в гибридном пайплайне

Промышленные системы отходят от требования «один айтем, один SID». GLIDE использует 4-уровневый SID с кодбуком 256, а коллизии внутри групп разрешаются выбором популярнейшего эпизода.

CQ-SID трактует SID как cluster ID: трёхуровневый кластерный код с крупными кодбуками позволяет сократить beam вдвое при том же качестве. Генеративный канал работает как источник кандидатов, а финальный ранкер обеспечивает точную идентичность.

4️⃣Коллизии как часть дизайна

Google в задаче ранжирования видео показал, что семантические коллизии полезнее случайных: близкие айтемы делят статистическую силу, что улучшает обобщение и холодный старт. Но для доменов, где точная идентичность важнее семантической близости, разрешение коллизий на основе популярности может систематически вытеснять длинный хвост.

Итог

Компромисс выразительности и эффективности снимается переходом к параллельной или гибридной генерации. Оптимум определяется не длиной SID, а совместным выбором кодбука, декодера, ограничением поиска и слоя разрешения.

#aivkhub #genrecsys #recsys
  • 🔥 3
  • ❤ 1
  • 👍 1
More from @aihubvk
  1. Sep 18, 2026Post #624
  2. Sep 17, 2026Вакансии для тех, кто хочет развивать рекомендательные системы и работать с большими модел…
  3. Sep 15, 2026Post #622
  4. Sep 11, 2026📱 Рекомендательные системы видео, клипов и постов работали раньше независимо: сигналы от…
  5. Sep 10, 2026Alignment: от ручной разметки к проверяемым наградам За аббревиатурами SFT, RLHF, PPO и GR…
  6. Sep 8, 2026На прошедших выходных прошла вторая встреча AI VK & Pro — место, где лиды ML и RecSys из б…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →