3 CIKM short papers + 2 RecSys demos 🎉 и немного новостей русскоязычного RecSys
Последние дни получились довольно насыщенными на хорошие research-новости: у нашей команды в Т-Банке приняли 3 short papers на CIKM 2026 и 2 demo papers на RecSys 2026 🎉
Про CIKM уже немного заспойлерил Кирилл: там у нас работы про evaluation, graphs и linear autoencoders. Про одну из RecSys demo расскажем чуть позже — небольшой спойлер: там будет встречаться DCN 🙂
А вторая — это наш open-source фреймворк Perseus, который вчера приняли в Demo Track RecSys 2026. Для нас это особенно приятно, потому что Perseus мы разрабатываем уже около двух лет: начинали с простых SASRec-like подходов, год назад концептуально рассказали о фреймворке на Practical ML Conf, недавно выложили фреймворк в open source, написали про него на Хабре и рассказали на Turbo ML Conf. Но не хватало ещё одного кирпичика — валидации со стороны международного research-сообщества. Теперь он появился 🙂
Вообще последние недели получились очень насыщенными на recsys-новости не только у нас. За последнюю неделю увидел много репортов о новых статьях ребят из русскоязычного recsys-коммьюнити, принятых на осенние конференции CIKM 🇮🇹 / RecSys 🇺🇸: у Саши Петрова (пост), Даши Тихонович (пост), Евгения Фролова (пост). Если кого-то забыл — напишите, пожалуйста.
Совсем недавно закончился SIGIR 🇦🇺, где точно были ребята из VK со статьями, а прямо сейчас проходит KDD 🇰🇷, куда, по сообщениям Кирилла, приехали 70+ русскоговорящих участников.
На KDD приехали и мои коллеги из Т-Банка — они презентуют статью с бенчмарком recsys-моделей на одном из самых больших открытых датасетов — 135B взаимодействий. Была проделана огромная работа по анонимизации и зашумлению данных. При этом в статье показано, что относительный порядок recsys-моделей по качеству сохраняется между открытой синтетической версией датасета и настоящими оригинальными данными. Поэтому хочется верить, что датасет будет полезен коммьюнити для бенчмаркинга recsys-моделей и разработки новых алгоритмов.
На внутреннем аналоге T-ECD мы, кстати, два года назад и начали развивать идеи, которые в итоге привели к Perseus. Если очень кратко, то у меня есть три основных тезиса про фреймворк:
1. Perseus покрывает простые сценарии типа SASRec на MovieLens-1M. Но для такого это, конечно, стрельба из пушки по воробьям.
2. Через Perseus, скорее всего, можно реализовать большинство прикладных offline-сценариев использования трансформеров для рекомендаций. Иногда я слушал доклады по recsys и ловил себя на мысли: «ну да, это можно реализовать через Perseus». Если вы сможете описать релевантный сценарий, который Perseus не покрывает, — будет очень интересно 🙂
3. Главное преимущество Perseus проявляется, когда у вас есть разнородные данные о пользователе с разными схемами. Например, покупки товаров, просмотры фильмов, отзывы об отелях, посты в соцсетях. Всё это можно упаковать в одну последовательность событий пользователя. Фреймворков, которые позволяли бы достаточно универсально работать с такими разнородными последовательностями, мы в открытом доступе не нашли. Поэтому и сделали Perseus.
Подробнее всё описано в статье на Хабре.
Надеюсь, кому-нибудь фреймворк понравится и принесёт реальную пользу. Если у вас появится сценарий применения, вопрос или фидбек — пишите в комментарии или в лс @lashinin, будем очень рады!
Post #26
1.38K








- ❤ 16
- 🔥 8
- 👍 3
- 😍 1