Допустим, у вас есть платформа для прослушивания подкастов. Задача: найти среди новых подкастов потенциально интересные широкой аудитории. Например, чтобы продвигать их на главной странице. Как решать такую задачу? Первое, что приходит в голову – собрать выборку с данными по “быстрым” метрикам подкастов (например, за первый день после выпуска), докинуть контентных признаков и обучить модель, которая предскажет долгосрочный успех. Исследователи из Spotify в своей статье утверждают, что такой подход не работает. Во-первых, ранние метрики дают нечестное преимущество подкастам знаменитостей и популярных блогеров, которые и так все послушают. Во-вторых, контент – слабый предиктор популярности. Намного лучше работает подход pure-exploration bandits.
Стандартные бандиты минимизируют cumulative regret, балансируя exploration и exploitation. Задача pure-exploration бандитов – найти лучшее действие, потратив фиксированный бюджет только на exploration. Предложенный в статье алгоритм ISHA не побеждает другие алгоритмы по метрикам – в экспериментах он на втором-третьем месте. Но зато ISHA лучше подходит для реальных систем: в отличие от конкурентов ему не нужно мгновенно знать награду после выбора действия. Это важно, потому что на практике между показом рекомендации и реакцией пользователя неизбежно есть задержка. Если мы готовы ждать реакцию сутки, ISHA отрабатывает за две недели, а лучшие по метрике алгоритмы SR и ECBT за год и 1000 лет соответственно. Думаю, в 3023 году людям не будут интересны перспективные подкасты из 2023. Разве что историкам.
На идею этой статьи можно посмотреть шире. Рекомендации – область, в которой мы можем не только строить модели, но и взаимодействовать с пользователями для контролируемого сбора данных. Мы делаем это в A/B экспериментах или реализуя exploration в продакшен рекомендерах. Но сегодняшняя статья подсказывает, что нужно идти дальше: механизмы работы с данными не достаточно “прикрутить сбоку” – их нужно закладывать в архитектуру системы при проектировании.
Post #41
1.16K
- 🔥 7
- 👍 2