И какой же вывод про RL в рекомендациях?
Учитывая посты, начиная отсюда, можно сделать ряд следующих выводов:
1) Статей на эту тему выходит достаточно много
2) Большая часть этих статей применяет метод без понимания того, зачем это нужно, какую проблему мы решаем, и чем при этом жертвуем
3) Большая часть оставшихся не содержит никакого тестирования на живых пользователях
Чтобы понять проблему оставшихся статей, нужно копнуть глубже.
В чём смысл исследований? Прежде всего, в поиске истины и построении модели мира. Когда у вас есть гипотеза о том, как устроен мир, вы пытаетесь проверять её на прочность, проводя эксперименты. Вы пытаетесь, что называется, prove yourself wrong - найти наблюдение, противоречащее вашей гипотезе. И вы делаете это усиленно, до тех пор, пока гипотеза не станет очень хорошо протестированной.
Утверждение "RL в рекомендациях превосходит классические подходы в чём-либо" - это гипотеза, которая точно не может считаться хорошо протестированной, но подвергнуть её серьёзной проверке практически не пытаются в исследованиях на данную тему. Добросовестный исследователь будет проводить дополнительные проверки, чтобы показать, что именно добавление RL-составляющей в пайплайн и только оно приносит значительную пользу.
К сожалению, практически все оставшиеся статьи не являются исследованиями в чистом смысле. Технические отчёты - да. Рекламные технические блоги - да. Но эти тексты публикуют как научные, они проходят ревью на уважаемых конфах, и потом их массово цитируют. Что с этим делать? Могу сделать только один неутешительный вывод - на слово нельзя верить даже научным статьям.
@knowledge_accumulator
Post #67
1.7K
- 👍 15
- 🔥 2
- 😢 2