TGViewer
Channel Public Channel
Red RecSys

Red RecSys

@redrecsys

RecSys и все что связано: ML, DL, карьера, open-source
Subscribers
1.22K
Photos
22
Videos
1
Links
31

Showing posts older than #16 · Back to latest

Older Posts 13 shown
Post #15 1.58K
Если вас увлекает DL и RnD в RecSys и интересно, куда всё движется в индустрии и академии прямо сейчас, очень советую подписаться на Колин канал. Мне кажется, это самый хардовый источник в RecSys из всех, кого я сейчас читаю в tg. Какие-то посты я разбиваю для себя на набор референсов и возвращаюсь к ним потом итеративно, это отлично работает.

А более обзорную и лайтовую подачу современных трендов от Коли можно посмотреть на его выступлениях, например "Будущее рекомендательных систем" на AHA!25.
Telegram Свет из чёрного ящика Открытый разговор о внедрении передовых рекомендательных технологий в экосистему Яндекса от @NikolaySav
  • 🔥 4
  • ❤ 3
  • 🤡 1
Post #14 3.34K
Генеративные рекомендации III. Хайп и хаос

Меняя компанию, я успела походить по собесам в области RecSys DL, и в одной из секций всегда всплывали генеративные рекомендации. Тема сейчас настолько хайповая, что в терминологии полный хаос, который идёт к нам ещё из научных статей. Пара примеров понимания "генеративных рекомендаций" из статей 23-25 годов:

“The first generative recommendation system in the literature” хочет назвать известная компания свою же прошлую архитектуру из “Actions…” (ICML'24). Сподвигает их к этому предложение "Generative Recommender", но их парадигма по сути только заменяет концепцию обучения с impression-based на авторегрессивную, не меняя ни задачи модели, ни способ инференса.

"In the paradigm of generative recommendation, the primary objective is to predict the next item a user is likely to interact with"
- хочет написать Huawei в препринте этого года. И приписывает таким образом пальму первенства генеративных рекомендаций ванильному SASRec из 2019 года (а то и BERT4Rec из 2018). Мотивация Huawei понятна: они обновляют архитектуру трансформера для простой Shifted Sequence модели (как это делают FuX-α, HSTU, eSASRec и пр.), не меняя концепцию обучения или задачи инференса. Но подчеркнуть актуальность статьи нужно, “Generative” в название статьи добавить хочется, и потому возникает такой вот финт, причём применяется он сейчас в статьях часто. Под "Generative" в заголовке статьи 2024-25 года часто будет скрываться именно авторегрессивная постановка обучения, без концептуальных нововведений на уровне моделирования. Разве что каузальная маска внимания может быть чуть видоизменена под конкретную задачу, как в "Generative Rankers" из моего прошлого поста.

“We propose a generative Next-K strategy, where recommendations are generated item-by-item” – пишет Саша Петров с соавтором в "Generative Sequential Recommendation..." (SIGIR’23). Тут реализуется простая идея: айтем, сгенерированный авторегрессивной моделью, можно подставить в последовательность и продолжить генерировать рекомендации дальше. Помимо жадной генерации есть и другие стратегии. Интуитивно очень понятный подход, и тут он «генеративный» уже в прямом смысле слова, без оговорок. Но хайпует сейчас другое.

“We propose a new paradigm ... Instead of traditional query-candidate matching approaches, our method uses an end-to-end generative model that predicts the candidate IDs directly.” – пишет Google в статье про TIGER (NeurIPS’23). TIGER использует полноценную энкодер-декодер архитектуру и обучается генерировать один следующий айтем (состоящий из набора иерархических semantic ids) для пользователя с заданной историей (в которой также каждый айтем представлен как набор semantic ids). Результаты на публичных датасетах у этой модели легко бьются простым SASRec с gBCE или SS лоссом, но важно далеко не это. Открывается целое направление в RecSys ресёрче:

“We propose OneRec, which replaces the cascaded learning framework with a unified generative model. This is the first end-to-end generative model” - пишут KuaiShou в препринте OneRec (2025). В данном случае одна модель заменяет собой все стадии индустриальных рекомендательных пайплайнов от кандидато-генерации до ранжирования. Прямая генерация айтемов по семантическим айди повторяет идею TIGER, так что в первом приближении модель относится к кандидато-генерации ("Generative Retrieval"). Но использование RL подходов в серии статей “One…” от KuaiShou
позволяет моделям дообучаться на максимизацию приносимого ими профита. По сути, это инкорпорация сразу и ранжирующего сигнала (конверсии в целевые действия - на которые учатся ранжирующие модели), и даже более общего экономического сигнала сразу в единую модель. Что в идеальном мире позволяет ей быть end-to-end генеративным рекомендательным движком, затюненным на полезность в сервисе. Так что законно задаёмся вопросом – не это ли RecSys будущего?

Про серию “One…” можно почитать хардовые разборы у Коли Савушкина из Яндекса и поучаствовать в ближайших ридинг группах VK.
arXiv.org Realizing Scaling Laws in Recommender Systems: A Foundation-Expert... Scaling laws have been established for recommender systems, yet efficiently deploying foundation model (FM) across multiple recommendation surfaces remains a major unsolved challenge. Existing...
  • 👍 9
  • 🔥 3
  • ❤ 1
Post #13 1.9K
Сегодня мой последний день в МТС

Всегда ценила МТС за людей, с которыми работала вместе. Если я напишу хоть одного человека, которому хочу сказать “спасибо” - дальше имена заполнят весь этот пост.

Я пришла 3.5 года назад джуном, после курсеры. И ухожу лидом, с опытом разработки опен-сорс фреймворка, развития рекомендашек в продуктах, платформизации, выступлений, преподавания, публикаций. Для меня это значит невероятно много. Ничто не далось просто так, и ничто не делалось в одиночку. Каждый проект - это совместная работа с кем-то важным для меня. И пока мы дизайнили / штормили / кодили / ревьюили / тестили / релизили / публиковали очередную историю - было здорово. В профессиональной жизни для меня это было счастливое время вместе с вами, и я его ценю.

Хочу сказать каждому, с кем мы познакомились, благодаря МТС, и сделали вместе что-то стоящее за эти несколько лет - самое тёплое спасибо.

RecTools без мейнтейнеров не останется, я верю в ребят ❤️
А впереди у меня теперь новые челленджи)
  • 🔥 52
  • ❤ 31
  • 😭 9
  • 🎉 3
Post #11 2.29K
Генеративные рекомендации II. По мотивам “Actions…”

Увидела актуальный список референсов для Generative Recommenders. Источник - препринт статьи от той же компании, что и оригинальный GR (Meta, признана экстремистской на территории РФ). Полный список: LiGR от LinkedIn, MTGR от Meituan, GenRank от Xiaohongshu, Argus от Yandex и UniGRF от Huawei и университетов Китая. Первые 4 подхода показали себя успешными в индустриальных А/Б тестах, последний проверялся только на публичных датасетах.

Как трансформируются в новых работах идеи GR?

Cхема Items-Actions Interleaving. “Actions…” предлагает схему обучения, где токены айтемов и действий чередуются, позволяя авторегрессионно решать одну из 2-х задач: Next-item или Next-action prediction. Все “наследники” кроме MTGR активно используют модальность действий (и некоторые добавляют контекст). LiGR и UniGRF сохраняют токены чередующимися и экспериментируют с объединением 2х задач в одной модели (хотя у LinkedIn не очень понятно, пошла ли объединённая модель в production). Argus и GenRank заменяют чередование токенов на суммаризацию эмбеддингов, чтобы оптимизировать compute. Argus - единственная модель, которая объединяет задачи, убирая interleave схему. Из интересного: Meta тоже отказывается от чередования токенов в последующих работах: Request-Only Optimization, Foundation–Expert Paradigm.

Отказ от impression-based семплов для ранжирующей модели . Авторы “Actions…” подчёркивают, что ранжирующая GR модель отличается от классических DLRM способом сборки обучающих семплов. Если DLRM с каждого показа пользователю айтема собирает один семпл для обучения с полным набором фичей, то GR группирует показы и историю пользователя в одну последовательность и предсказывает с такого семпла действия сразу для многих показанных айтемов. Все работы по мотивам “Actions…” следуют этому подходу, несмотря на отличающиеся архитектуры моделей. При этом индустриальные работы подчёркивают, что такой способ сборки обучения оптимизирует compute и способствует масштабированию моделей, а масштабирование в свою очередь растит качество.

“Target-aware cross attention in one pass” и адаптивная маска внимания. Оригинальная схема Items-Actions Interleaving позволяла авторам учить ранжирующую модель авторегрессионо и использовать target-aware attention (query нового айтема-кандидата смотрел по каузальной маске в прошлое - на keys и values всей истории пользователя до него). Обычно на инференсе такая схема означала бы необходимость в рантайме “подставлять” кандидатов в последовательность пользователя по одному и для каждого прогонять трансформер, чтобы получить предсказания (что долго). Авторы “Actions…” предлагают батчевый инференс для target-aware внимания: кандидаты подставляются в конец последовательности одновременно, и трансформер прогоняется один раз, при этом кандидаты благодаря адаптивной маске внимания никак не влияют друг на друга. За исключением Argus и LiGR, индустриальные “наследники” не используют авторегрессионное обучение ранжированию. Зато идея target-aware cross внимания в один проход используется не только для инференса, но и для обучения модели. GenRank, MTGR, а также 2 работы Meta описывают общий подход: группируем кандидатов для юзера за некоторый временной промежуток, ставим их в конец последовательности, корректно формируем маску внимания, чтобы они не влияли друг на друга - и учим модель предсказывать действия для каждого из них. Временным промежутком при этом может например быть один запрос рекомендаций, то что Meta называет “Request-Only Optimizations training and modeling paradigm”.

В целом, кажется, что GR из “Actions…” трансформируется либо в авторегрессионную архитектуру, совместно моделирующую и кандидато-генерацию, и ранжирование (как Argus, и возможно LiGR, а также непроверенный UniGRF). Либо становится Generative Ranking - чисто ранжирующей моделью c target-aware вниманием на пачку кандидатов “в один проход” (как MTGR, GenRank и новые работы Meta).
arXiv.org Request-Only Optimization for Recommendation Systems Deep Learning Recommendation Models (DLRMs) represent one of the largest machine learning applications on the planet. Industry-scale DLRMs are trained with petabytes of recommendation data to...
  • ❤ 4
  • 👍 4
  • 🔥 3
Post #10 1.77K
Fun fact из разработки для RecTools: cамые мощные истории из числа последних (модульные трансформеры, HSTU) - были подготовлены ребятами, проходившими у меня в МТС стажировку.

Да, у них были референсные имплементации, целевые метрики, им было кому задавать вопросы и с кем штормить проблемы. У них был дизайн архитектуры кода и постоянно проходил код ревью, перед релизом - сразу 2-х мейнтейнеров. И всё же тот объём работы, который ребята смогли затащить, не имея до этого опыта в индустриальной разработке - 🔥.

Мне особенно нравится, что каждый из них сам рассказывает коммьюнити о результатах своей работы.
Выступление Майи с презентацией релиза трансформеров можно посмотреть в записи True Tech митапа.
А Лёша скоро будет рассказывать про имплементацию HSTU на ридинг-группе ML это OK.

Если у вас возникает мысль “мне бы такие задачи на стажировке” - я с вами. Я в их время была фотографом 📸
  • 🔥 18
  • ❤‍🔥 2
  • ❤ 1
Post #9 3.09K
Генеративные рекомендации I. “Actions…”(2024)

Тема генеративных рекомендаций развивается на наших глазах - и поэтому не так просто её сходу систематизировать. Решила разложить по полочкам то, что выделяла для себя.

“Generative Recommender” (GR) из “Actions speak lourdes than words…”

Провокационная история - авторы очень красиво пишут, что их GR подход выучивает совместное распределение над последовательностями контента и действий пользователей с этим контентом - в схеме item-actions interleaving. И показывают на картинке, что в качестве следующего токена можно предсказывать, как следующий айтем, так и действие с ним. Проблема только одна - next-item и next-action задачи авторы не объединяют в одной модели и общего подхода к их действительно совместному использованию не предлагают.
Next-item задача при этом вырождается в (сильно) продвинутый SASRec с добавлением гетерогенных фичей (и негативных действий) в последовательность - и предсказанием только позитивных взаимодействий. А next-action задача прокачивает DLRM-модель с impression-level обучения (один показ айтема пользователю = один семпл для обучения модели) до “генеративного” обучения, где предсказания целевых действий происходят сразу по пачке показанных пользователю айтемов.
Вот только…
1. Формирование последовательностей из позитивных и негативных действий, добавление эмбеддингов на разные типы действий, авторегрессионное обучение и предсказание только позитивных действий - всё это было описано ещё в 2022 году в PinnerFormer. Новых идей тут немного - кроме самой схемы подачи токенов.
2. Ранжирующие модели над последовательностями позитивных и негативных действий, с эмбеддингами типов действий, ранним связыванием и т.п., тоже уже были - те самые DLRM, которым GR противопоставляется (например TransAct). “Генеративность” ранжирующей GR-модели авторы описывают самой постановкой обучения - “generative training”. Они предлагают делать один проход модели с каузальной маской над историей, а также с ранним связыванием сразу на батч айтемов, действия с которыми надо предсказать (“target-aware cross attention in causal-masked settings… in one pass”). И в большей степени такая постановка меняет способ создания выборки для обучения и сам процесс обучения, чем цель применения ранжирующей модели.
3. А что HSTU? По факту это просто ещё одна архитектура трансформера, которая напрямую не связана с генеративными рекомендациями. Кроме клейма авторов, что она достаточно экспрессивна для того, чтобы модель на её основе могла обходиться без вручную сгенерированных фичей-счётчиков. Но это далеко не единственный способ решения проблемы (есть например LiGR). На публичных бенчмарках авторы статьи показывали именно результаты HSTU архитектуры в классической "Shifted Sequence" постановке обучения, без схемы с использованием actions - что не совсем очевидно при беглом прочтении.

И тем не менее, “Actions…” - статья невероятно влиятельная, hands down. Авторы предложили общее идеологическое видение того, куда можно двигаться дальше. Самый “прямой” наследник идей на основе item-actions-interleaving, мне кажется, Argus, в котором сделали следующий шаг - и соединили таки задачи next-item и next-action в одной модели (помимо множества других нововведений и последующего перехода к генерации сессий). Но эту историю вы и так знаете.
arXiv.org Actions Speak Louder than Words: Trillion-Parameter Sequential... Large-scale recommendation systems are characterized by their reliance on high cardinality, heterogeneous features and the need to handle tens of billions of user actions on a daily basis. Despite...
  • 👍 14
  • 🔥 7
  • ❤ 1
Post #8 8.55K
"eSASRec: Enhancing Transformer-based Recommendations in a Modular Fashion»

Нашу статью приняли на ACM RecSys 2025! (arxiv).
Совместная работа с Никитой Зелинским, Сашей Петровым, исследователями из МТС (и экс-МТС), а также с Андреем Савченко.

В работе мы представляем модульный взгляд на классические трансформерные бейзлайны в RecSys и ищем наиболее эффективную архитектуру (собранную по принципу лего), которая показывает хорошее качество в самых разных сетапах - от привычной LOO валидации на небольших академических датасетах до парето-оптимальности (в рамках NDCG / Beyond-Accuracy качества) на тайм сплите. Финальная связка - которую мы назвали eSASRec - получилась из «Shifted Sequence" задачи обучения (как в SASRec), LiGR архитектуры слоёв трансформера (как в продовой модели LinkedIn из «From Features to Transformers…») и Sampled Softmax лосса (тут без сюрпризов, хотя стоит сказать, что gBCE был очень близок по качеству, но не всегда быстро сходился).

На самом деле, в рамках этой достаточно долгой работы (первые экспы начались больше чем полгода назад) мы отвечали и на более широкий спектр вопросов. В академии есть свой заданный «порядок» для написания статей, и мы не могли добавить никаких выводов сверх основного фокуса работы. Так что вот основные официальные выводы статьи: есть обновленный SASRec, и он хорош во всех сетапах, в которых мы его тестили. Например, он даёт взрывные +23% от качества ActionPiece и TIGER в академических бенчмарках. А ещё в терминах парето-оптимальности он держит качество на уровне HSTU и FuXi, хотя в отличие от последних не использует таймстемпы ни в истории пользователей, ни при формировании рекомендаций. Ещё eSASRec максимально просто имплементировать и он не имеет проблем с масштабированием (тут спасибо LinkedIn за архитектуру). И мы открываем доступ к нашим имплементациям и коду бенчмарков.

А теперь - что в статью не вошло, и о чём можно было бы подискутировать).

Лично для меня помимо определения современного бейзлайна самым интересным был вопрос - можно ли верить SOTA клеймам на основе академических RecSys датасетов?

Я отвечу для начала очень простым примером из наших результатов: классическая LOO валидация на самых популярных датасетах Амазона показала, что давно известный вариант SASRec+SS без каких-либо обновлений уже давал те самые +23% к качеству ActionPiece и TIGER. Просто никто этот вариант на данных датасетах в качестве бейзлайна не заводил. А завели вариант BCE, 1 негатив, имплементация RecBole, 5 лет назад - и с тех пор только копипастили из статьи в статью. Значит ли это, что SASRec+SS такая уж «SOTA» рядом с TIGER?

По моим ощущениям (мы же дискутируем?), результаты на Amazon Beauty/Sports/Toys в целом не то чтобы отражали реальную полезность моделей - они явно отдают предпочтение более простым архитектурам. Например, оптимальные гипер-параметры там: 1 слой трансформера, 1 голова, количество факторов 64. А ещё HSTU и FuXi на этих датасетах тоже ощутимо «проигрывают» старенькому SASRec+SS. Хотя на Мувиленсе - уже ощутимо “выигрывают”.

Про тайм сплит и beyond-accuracy: мы в статье отмечаем эффективность моделей индикаторами Парето-оптимальности. Это позволяет хоть немного делать выводы о результатах архитектур между разными датасетами (пока нет общепринятого академического подхода для оценки степени трейд-оффа точности и “персонализации”). Наши выводы - что есть архитектуры, которые оставались Парето-оптимальными на всех тестовых датасетах (например, HSTU и eSASRec). Но даже между ними нельзя сказать заранее, какая модель окажется выше по NDCG, а какая - выше по Coverage, всё сильно зависит от данных. Не самый утешительный вывод в ML, где мы привыкли к "вот это State-of-the-Art - и ." Зато честный.

Спасибо всем, с кем мы вместе сделали эту работу ❤️
arXiv.org eSASRec: Enhancing Transformer-based Recommendations in a Modular Fashion Since their introduction, Transformer-based models, such as SASRec and BERT4Rec, have become common baselines for sequential recommendations, surpassing earlier neural and non-neural methods. A...
  • 🔥 15
  • ❤ 10
  • 🥰 2
  • 👍 1
Post #6
Red RecSys pinned «Привет! Меня зовут Даша Тихонович. Последние 3,5 года я увлечена разработкой рекомендательных систем. Вы можете знать меня как мейнтейнера фреймворка RecTools, где мы с ребятами имплементировали SOTA модели в парадигме fit/recommend. Или как спикера на конференциях…»
Post #5 3.54K
Привет! Меня зовут Даша Тихонович. Последние 3,5 года я увлечена разработкой рекомендательных систем. Вы можете знать меня как мейнтейнера фреймворка RecTools, где мы с ребятами имплементировали SOTA модели в парадигме fit/recommend. Или как спикера на конференциях / митапах, автора статей (доклад про pop bias, публикация eSASRec, статья «Дропаем ранжирующие метрики…», ридинг-группа про трансформеры в RecTools). Возможно, вы видели меня среди лекторов курсов в ИТМО / Вышке / МТС-ШАДе. А может быть, мы просто пересекались в тёплой компании увлечённых людей (и это здорово!).

У меня бывают новости, которыми я обычно делилась в общих каналах по RecSys, но думаю, что пора переезжать в личный канал. Релизов здесь не будет)

Anyway - welcome! Если мы не встречались, то будем знакомы. Сейчас я стафф DL разработчик в Яндексе в направлении RecSys RnD, до этого - лид команды нейросетевых рекомендаций в МТС. Ко мне можно на ты!
YouTube Валидация в RecSys для корреляции с А/В: что работает в контентных рекомендациях / Дарья Тихонович Приглашаем на следующую конференцию AiConf 20 апреля 2026 года. Подробности тут — https://aiconf.ru/2026/ ________ Прикладная конференция по Data Science AiConf 2024 Презентация и тезисы: https://aiconf.ru/2024/abstracts/12727 Проблема разрыва между…
  • ❤ 13
  • 🔥 9
  • 👍 3
Post #2
Channel photo updated
Post #1
Channel created
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →