Mitigating Collaborative Semantic ID Staleness in Generative Retrieval
После учёта финальных правок от ревьюеров могу наконец рассказать, что за работу у меня приняли :)
Идея статьи пришла ко мне пока я был еще в Яндексе и занимался генеративными подходами. На последнем 1x1 Коля Савушкин (в то время мой руководитель) спросил меня, что я собираюсь делать. Помню, что идея этой работы была одной из первых в моем списке, и надеюсь, что ещё не последней, которую получится опубликовать.
Сама же статья предлагает подход того, как можно дообучать модель для генеративного ретривала, в которой коллаборативный сигнал используется для построения семантиков (а-ля OneRec или PLUM).
Подходы такого вида двустадийные: изначально мы учим токенизатор по представлению айтемов строить семантики, затем используем эти семантики для обучения уже самого ретривера. Чтобы семантики получились качественные одним из решений является обучать токенизатор как на контентное, так и на коллаборативное представление, и вот тут возникает проблема.
Так как коллаборативный сигнал меняется со временем, то вполне устоявшаяся практика — дообучать модели чтобы подстроиться под эти изменения. Однако, для GR моделей это означает, что надо дообучать не только ретривер, но и токенизатор. Если же дообучить второй, то полученные токены могут сильно отличаться от тех, что были до дообучения и при дообучении уже ретривера ему придется решать более сложную задачу: перемапить старые токены в новые и учесть новый коллаборативный сигнал.
А как именно я решаю это проблему приглашаю посмотреть в самой статье. Очень жаль, что было мало времени до дедлайна, так что результатов хватило только на short paper, но я сильно рад этому результату! Буду на конференции искать ребят из DeepMind и продавать им эту идею :)
P.S. Если кто-то из читатей планирует поехать в Мельбурн на конференцию, буду рад встречи там!
Статья | Код
Post #15
1.23K

- 🤩 29
- 🔥 11
- 🏆 9
- 💋 3
- ❤ 1
- 🐳 1