Александр Калистратов, выпускник Центра «Пуск» МФТИ, в выпускной работе исследовал рекомендательные системы на базе LLM.
Обычно товар в рекомендательной системе представлен своим ID. Александр действовал иначе: представил каждый товар как последовательность специальных токенов — семантический идентификатор. Если у товаров совпадает часть такой последовательности, они похожи по смыслу. Эти новые токены Александр добавил в словарь LLM.
Эксперимент проводился на подмножестве Amazon Pet Supplies: 63 тыс. товаров и больше 100 тыс. историй покупок.
Модель проверяли на четырех задачах, и они делятся на два типа:
— семантические — сгенерировать текст по идентификатору и, наоборот, получить идентификатор по тексту;
— коллаборативные — предсказать сопутствующий товар и следующий товар в истории взаимодействий пользователя.
Как на качество влияет размер модели
Сначала Александр сравнил четыре LLM семейства Qwen разного размера: 0,6 млрд, 1,7 млрд, 4,8 млрд и 8 млрд параметров.
На семантических задачах более крупные модели лучше связывали идентификаторы с информацией о товаре: точнее генерировали идентификатор по тексту и текст по идентификатору. Основной прирост был при переходе от модели с 1,7 млрд параметров к модели с 4 млрд. Дальше разница между моделями сокращалась и уже не достигала статистической значимости.
На коллаборативных задачах увеличение модели прироста не дало.
Как влияет способ инициализации новых токенов
Когда в словарь LLM добавляют новый токен, для него нужно задать эмбеддинг — вектор, с которым модель будет дальше работать. Александр проверил четыре способа задать начальные значения этих эмбеддингов.
Лучше всего сработал вариант, в котором использовали знания, уже заложенные в модели. Названия товаров разбивали на знакомые LLM токены и брали их эмбеддинги, чтобы на их основе инициализировать новые токены. По словам Александра, так они сразу оказывались «почти в правильном месте» в векторном пространстве.
На семантических задачах этот способ показал значимо лучший результат. А вот на предсказание сопутствующего и следующего товара способ инициализации не влиял.
Собственный метод Александра — проекция кодовой книги — оказался худшим из четырех.
Что в итоге
Если нужно научить модель связывать новые идентификаторы с текстом, имеют значение и размер модели, и способ инициализации.
А в задачах на предсказание сопутствующего или следующего товара ни увеличение модели, ни способ инициализации прироста в этом эксперименте не дали.
Как говорит Александр, для одних рекомендательных задач есть смысл «запариваться с большим размером модели и всеми вытекающими», а для других — нет.
⏺Полную запись эфира смотрите по ссылке: https://vkvideo.ru/video-224205661_456239143
