Лучший способ продемонстрировать прирост
Продолжаем разговор про исследования RL в рекомендациях, начатый тут.
Ккогда вы разрабатываете новый метод для улучшения системы, которую сами делаете, то никто, кроме вас и ваших коллег, не ориентируется в вашей задаче и не может сходу оценить реальность прироста. Это открывает простор для такой хитрости, как плохие бейзлайны.
Очень часто при внимательном прочтении статьи я нахожу проблему в сравнении RL-метода с "классическим" методом. Хорошей иллюстрацией будет следующая статья, у которой >60 цитирований.
Здесь RL-метод обучается на сложную награду в задаче ритейл-рекомендаций: суммируется награда за клик с поправкой на позицию в выдаче, награда за покупку после этого клика и награда-нормировка, зависящая от того, как часто на что-нибудь кликает пользователь.
Против него соревнуется модель, которая просто обучается на то, был ли клик на карточку.
Разумеется, по итоговым бизнес-метрикам RL победил, поскольку он хоть как-то учитывает информацию об итоговой покупке. Более того, он победил кликовую модель по CTR, вероятно, благодаря скорректированной награде за клик.
На мой взгляд, этого результата недостаточно, чтобы доказать нужность очень сложных в реализации, отладке, тестировании и поддержке RL-методов. А вы как считаете?
@knowledge_accumulator
Post #65
1.85K
- 👍 13
- ❤ 2
- 🤨 2