#recsys #dataset #news
VK-LSVD: Large Short-Video Dataset
Особенный домен
Я пришел в RecSys из CV, где публичным бенчмаркам можно было доверять: результаты из научных статей хорошо коррелировали с продом. Поэтому, возглавив RecSys R&D, я предложил стратегию экспериментов с SotA моделями из академических статей, но практически на все предложения услышал: “уже пробовали, на нашем масштабе прироста нет”.
Различия в методах валидации и доступности данных в академии и индустрии оказались внушительными. И хотя сейчас ситуация чуть лучше, RecSys всё ещё сильно отстаёт от CV/NLP.
Что предлагает сообщество?
Многие из выкладываемых датасетов содержат только то, что можно спарсить самостоятельно (например, отзывы и контент, как в Amazon Reviews, MovieLens или MicroLens). Однако ключевые сигналы для рекомендаций индустриальные системы получают вовсе не из отзывов.
Netflix, сильно забустивший индустрию, после знаменитого соревнования погряз в судебных процессах и перестал публиковать свои данные.
Интересные датасеты выкладывают Tencent (Tenrec) и Kuaishou (KuaiRec). Но несмотря на сотни миллионов DAU их сервисов, эти данные все еще очень далеки от индустриальных масштабов.
Что решил сделать я?
Я опубликовал самый близкий к индустриальным масштабам рекомендательный датасет VK-LSVD с 40В взаимодействий. Второй по размеру сейчас MLHD с 27B взаимодействий, а замыкает тройку свежая Yambda на 4.79B записей логов.
Ключевые отличия VK-LSVD
40B взаимодействий. Упорядоченные по времени данные за 6 месяцев, которые включают и просто показы без реакций.
7 видов фидбека. Кроме привычного таймспента есть лайки, открытия комментов, шэры, закладки, дизлайки, клики на автора.
3 вида контекста. Место взаимодействия (лента, поиск, группы,…), платформа (десктоп, тв, смартфон,…), агент (тип браузера, клиента в приложении,…).
20M айтемов. Для каждого клипа известен автор, длительность и контентный эмбеддинг (недавно рассказывали, как их варим).
10M пользователей. С возрастом, полом и гео.
Кастомный сабсемплинг. В индустрии часто приходится решать задачу согласованности оффлайн-метрик с онлайн-результатами для ускорения проверки гипотез. Академия может помочь нам с исследованием стратегий семплинга, результаты которых хорошо соотносятся с метриками на больших выборках.
Почему именно клипы?
В работе мне доступно много форматов (от музыки до знакомств), но именно клипы выглядят самыми подходящими для бенчмаркинга.
Во-первых, в один момент времени на экран помещается один клип, что сильно упрощает атрибуцию фидбека: скип в клипах более осознанный сигнал, чем на витрине из 9 длинных видео, часть которых пользователь даже не заметил.
Во-вторых, в этом формате практически отсутствует фоновое потребление, которое добавляет шум в других видах контента: например в музыке, действительно ли дослушанный пятый из десяти трек в сессии это позитивный сигнал?
В-третьих, удобный интерфейс и десятки просмотров за сессию дают системе много фидбэка.
Все это повышает точность оффлайн-оценки алгоритмов и позволяет добиваться лучшей корреляции с онлайном. Кроме того, выводы, полученные на клипах, хорошо обобщаются и на другие форматы (что мы наблюдали с DB&NWT).
Что дальше?
Датасет готов к вашим экспериментам, впереди еще статья и масштабное соревнование, так что stay tuned.
@ds_league
Post #9
4.1K

- 🔥 22
- ❤ 5
- 👏 5
- 🏆 5