TGViewer
Information Retriever Information Retriever @inforetriever · 4.14K subscribers
Post #308 2.37K
ACM RecSys’25, день первый.

1. Больше всего времени я провёл на воркшопе СONSEQUENCES’25. Происхождение названия:
An increasing amount of research understands recommender systems as a decision-making problem, instead of a pure prediction problem. Indeed, this view of the recommendation task makes it clear that recommendation decisions on real-world platforms have consequences. 


В рамках воркшопа был очень хороший туториал про бандитов для рексистем “Practical Bandits: An Industry Perspective” от авторов из Booking, Netflix, Spotify, Amazon. На ютубе есть запись одноименного туториала с WWW’23. Она двухлетней давности, зато в три раза больше по длительности. Что было на сегодняшнем туториале:

Дали определение контекстуальных бандитов, рассказали про минусы on-policy подходов, рассказали про off-policy методы (про importance weighting, cIPS, SNIPS, DR, etc). Сказали, что on-policy — это “optimism in the face of uncertainty”, что мы выбираем действия, в которых не уверены, надеясь на лучший исход; и что off-policy — это наоборот пессимизм :)

Также сказали, что нужно рандомизировать данные, добавлять рандом к текущей продовой политике (если она детерминированная). Был рассказ про различные способы рандомизации (epsilon-greedy, софтмакс-сэмплирование, упомянули Thompson sampling, сказали прочитать статью Olivier Jeunen с этого рексиса — видимо, вот эту). Также было чуть-чуть про Plaсkett-Luce и Гумбеля. И была байка про то, как с помощью control variates авторы из Амазона диагностировали у себя багу в функционале “Play music” Алексы, что у них часть фидбека не доезжала до модели.

Еще я впервые услышал термин “symbiosis bias”. Так докладчики назвали эффект, когда все тестируемые алгоритмы используют весь трафик для обучения, и из-за этого сравнение становится некорректным. В такой ситуации всегда будет выигрывать более жадная политика, в которой меньше эксплорейшна. Из-за похожей логики мы не можем и в обычном A/B нормально замерять эффект от эксплорейшна. По крайней мере, без таких титанических усилий, как в статье от Google DeepMind Long-Term Value of Exploration.

Еще был кусочек про то, как работать с очень большими пространствами действий.

Я, собственно, очень поверхностно перечислил про что был туториал, если заинтересовал — призываю посмотреть ту самую трехчасовую версию с WWW’23. Лекция этого года тоже наверняка станет доступна, но вероятно не скоро.

Вдогонку, если вас заинтересовала тема counterfactual learning’а, то есть еще один клёвый трехчасовой туториал от Yuta Saito и Thorsten Joachims с RecSys’21 (тык) — подробный рассказ про всевозможные off-policy методы для бандитов.

2. Также уже состоялась первая постерная сессия, на которой были статьи с того же воркшопа CONSEQUENCES. Выделю одну статью — Unidentified and Confounded? Understanding Two-Tower Models for Unbiased Learning to Rank. Пользователи чаще кликают на верхние позиции выдачи из-за position bias’а, и один из способов это побороть — это обучить совместно сумму “bias-башни” и основной модели. Bias-башня при этом на входе использует только позиционные данные, а основная модель их наоборот игнорирует. При обучении используем обе башни, при применении bias-башню отбрасываем. В идеале bias-башня перетягивает на себя весь позиционный bias.

Пару лет назад Google Research в статье Towards Disentangling Relevance and Bias in Unbiased Learning to Rank подсветили следующую проблему — так как позиция в выдаче коррелирует с релевантностью (обычно мы определяем позицию, отранжировав по релевантности), то “bias-башня” начинает перетягивать на себя полезный сигнал, отражающий релевантность. Из-за этого основная модель, которую мы применяем в проде, часть сигнала про релевантность теряет. Чтобы это побороть, предложили использовать дропаут скора bias-башни, или вообще использовать gradient reversal.

Так вот — автор вышеупомянутой статьи утверждает, что они не правы. Что у них неправильные симуляции, и вообще все работает по-другому (а как — читайте в его статье). А еще он процитировал наш старый препринт про трансформер в Маркете :)
  • ❤ 29
  • 👍 6
  • 🔥 2
  • ✍ 1
More from @inforetriever
  1. Oct 3, 2026Воскрешаю рубрику про забавные рекомендации, в этот раз на Ютубе. Возможно, это генеративн…
  2. Sep 29, 2026Как прошли мои первые две недели на работе, в числах: * 35 1-1 встреч * 175 чатов в телегр…
  3. Sep 24, 2026Не знаю, как студенты сейчас проводят свободное время (кэгл решают?), а мы в свое время по…
  4. Sep 24, 202628 сентября начинается ACM RecSys'26 в Миннесоте. Впервые за три года его пропускаю (RecSy…
  5. Sep 22, 2026По мотивам поста Вани Рубачёва Вечная классика
  6. Sep 19, 2026А я сегодня стал лауреатом премии Yandex ML Prize! В номинации “Преподаватели”. Спасибо вс…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →