TGViewer
Information Retriever Information Retriever @inforetriever · 4.13K subscribers
Post #406 4.64K
Wake up, honey, a new Google DeepMind RecSys paper just dropped.

Вышла статья ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging от авторов TIGER и PLUM.

Если натюнить LLM на рекомендательную задачу, она теряет способность "разговаривать", если не тюнить — качество рекомендаций плохое. Как получить модель, которая одновременно и разговаривает, и хорошо рекомендует?

Про PLUM. В PLUM они файнтюнили Gemini на задачу рекомендаций в два этапа:
1) Сначала учили модель понимать каталог через две задачи — предсказание следующего айтема и восстановление метаданных айтема по semantic ID
2) Затем дообучали на generative retrieval

В статье были черри-пикнутые примеры на тему того, что после первой стадии модель все еще понимает естественный язык. Но про вторую стадию таких примеров не было, что наводило на мысль, что после generative retrieval fine-tuning разговорные способности теряются. Собственно, в новой статье они про это явно сказали.

Что делают в новой статье. Используют model merging — простое усреднение параметров нескольких чекпойнтов модели. Берут исходный "разговорный" чекпойнт LLM (здесь это 1B версия Gemma3) и усредняют его с дообученной на рекомендации версией. Если усреднять уже в самом конце дообучения, то работает плохо, а вот если по мере дообучения раз в какое-то количество шагов — работает хорошо.

Origin-Regulated Merging. Метод Soup-to-go, который раз в K шагов обновления параметров делает слияние моделей, уже довольно неплохо работает. Но авторы смогли относительно него еще улучшиться — заметили, что чем "дальше" модель от исходного разговорного чекпойнта, тем больше падают способности, связанные с текстом. Они ввели метрику близости между чекпойнтами модели (рассматривают два варианта — евклидово расстояние и доля несовпадающих по знаку параметров) и задали пороговое значение метрики, после которого должно срабатывать слияние текущего чекпойнта с исходной LLM. Сначала слияние происходит часто (e.g., каждые 500 шагов), затем реже (каждые 3к шагов).

Мое мнение.
* Как всегда, пользуются надежным рецептом успеха — адаптируют к рексистемам общие deep learning техники. Кажется, в DL такой трюк используют с 2022-го года — начиная со статьи Model Soups
* Для замера рекомендательного качества используют очень нереалистичный сетап из TIGER — Amazon reviews с leave-one-out сплитом, еще и всего 20 событий в истории пользователя
* И важный момент — усредненная модель всё еще существенно хуже на рекомендательных задачах, чем просто зафайнтюненная модель; и хуже на разговорных, чем исходный LLM чекпойнт
  • 🔥 33
  • 😁 6
  • ❤ 4
  • 👍 1
More from @inforetriever
  1. Sep 24, 2026Не знаю, как студенты сейчас проводят свободное время (кэгл решают?), а мы в свое время по…
  2. Sep 24, 202628 сентября начинается ACM RecSys'26 в Миннесоте. Впервые за три года его пропускаю (RecSy…
  3. Sep 22, 2026По мотивам поста Вани Рубачёва Вечная классика
  4. Sep 19, 2026А я сегодня стал лауреатом премии Yandex ML Prize! В номинации “Преподаватели”. Спасибо вс…
  5. Sep 19, 2026Я не покемон, но меня можно сегодня поймать на Practical ML Conf :)
  6. Sep 18, 2026WARNING: пост на отвлеченную тему)) Я люблю историю. В детстве мне попадались различные кн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →