Рекомендательные системы
Всё, чему нас учили - неправда
Следующая серия постов будет посвящена получению Business Value от рекомендательных систем (RecSys). А пока поделюсь с вами довольно значимым научным открытием в 2020 году:
Оказалось, что некорректно использовать наши любимые NDCG, precision@k, recall@k для сравнения моделей, если эти метрики посчитаны на сэмпле данных. Вместо этого корректно использовать AUC@k 😱
А сэмплирование используется почти во всех продакшн-системах, так как товаров сотни тысяч, а то и миллионы (метрики считают обычно на сэмпле из 100-1000 товаров)
Видео с KDD-2020 на эту тему (всего 15 мин)
Для тех, кто не очень близок к сфере recsys: в 99% курсах на первом же уроке говорят, что использовать AUC для оценки качества ранжирования нельзя, т.к он плохо учитывает порядок рекомендаций
На очень годных курсах добавляют, что AUC@k чуть получше, но тоже не айс 🥶
И настоятельно советуют использовать те самые NDCG, precision@k, ...
Вот так и переворачиваются в момент все представления о задаче ранжирования
P.S. Сколько же раз, получается, я выбирал модель на основе некорректных метрик..
#recsys
Post #47
753