TGViewer
Науки о данных | МФТИ Науки о данных | МФТИ @mipt_datascience · 337 subscribers
Post #197 60
Задача: нужно улучшить рекомендательную систему на базе LLM. Что даст эффект — изменить размер модели или способ инициализации новых токенов? 

Александр Калистратов, выпускник Центра «Пуск» МФТИ, в выпускной работе исследовал рекомендательные системы на базе LLM.

Обычно товар в рекомендательной системе представлен своим ID. Александр действовал иначе: представил каждый товар как последовательность специальных токенов — семантический идентификатор. Если у товаров совпадает часть такой последовательности, они похожи по смыслу. Эти новые токены Александр добавил в словарь LLM. 

Эксперимент проводился на подмножестве Amazon Pet Supplies: 63 тыс. товаров и больше 100 тыс. историй покупок.

Модель проверяли на четырех задачах, и они делятся на два типа:
— семантические — сгенерировать текст по идентификатору и, наоборот, получить идентификатор по тексту;
— коллаборативные — предсказать сопутствующий товар и следующий товар в истории взаимодействий пользователя.

Как на качество влияет размер модели 

Сначала Александр сравнил четыре LLM семейства Qwen разного размера: 0,6 млрд, 1,7 млрд, 4,8 млрд и 8 млрд параметров. 

На семантических задачах более крупные модели лучше связывали идентификаторы с информацией о товаре: точнее генерировали идентификатор по тексту и текст по идентификатору. Основной прирост был при переходе от модели с 1,7 млрд параметров к модели с 4 млрд. Дальше разница между моделями сокращалась и уже не достигала статистической значимости. 
На коллаборативных задачах увеличение модели прироста не дало.

Как влияет способ инициализации новых токенов

Когда в словарь LLM добавляют новый токен, для него нужно задать эмбеддинг — вектор, с которым модель будет дальше работать. Александр проверил четыре способа задать начальные значения этих эмбеддингов.

Лучше всего сработал вариант, в котором использовали знания, уже заложенные в модели. Названия товаров разбивали на знакомые LLM токены и брали их эмбеддинги, чтобы на их основе инициализировать новые токены. По словам Александра, так они сразу оказывались «почти в правильном месте» в векторном пространстве. 

На семантических задачах этот способ показал значимо лучший результат. А вот на предсказание сопутствующего и следующего товара способ инициализации не влиял.
Собственный метод Александра — проекция кодовой книги — оказался худшим из четырех.

Что в итоге

Если нужно научить модель связывать новые идентификаторы с текстом, имеют значение и размер модели, и способ инициализации.

А в задачах на предсказание сопутствующего или следующего товара ни увеличение модели, ни способ инициализации прироста в этом эксперименте не дали.

Как говорит Александр, для одних рекомендательных задач есть смысл «запариваться с большим размером модели и всеми вытекающими», а для других — нет.


⏺Полную запись эфира смотрите по ссылке: https://vkvideo.ru/video-224205661_456239143
  • ❤ 1
More from @mipt_datascience
  1. Sep 22, 2026💻«Мы учились удаленно — а эффект от Физтеха остался» В этом году Максим Зимаков окончил о…
  2. Sep 14, 2026👥 Что отличает сильного кандидата в Data Science На эфире МФТИ о карьере в Data Science А…
  3. Sep 7, 2026🤩🚀 Новый учебный год в МФТИ начался Студенты онлайн-магистратуры уже приступили к заняти…
  4. Aug 29, 2026🤔 Задача: почему RAG может находить не то, что вы у него спрашиваете VEDA — ИИ-платформа…
  5. Aug 15, 2026⏰ Сегодня последний день приема документов в онлайн-магистратуры МФТИ Подать заявление на…
  6. Aug 13, 2026⏳ До конца приема документов — 2 дня Подать документы в онлайн-магистратуры МФТИ можно тол…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →