Как мы пытаемся сводить RL к Supervised Learning
Представьте, что вы разрабатываете рекомендательную систему для интернет-магазина.
Действия агента - это показы пользователю товаров, а положительной наградой является покупка.
Покупка может произойти через время после показа, и в результате награда будет отложена с точки зрения показа этого товара.
Мы могли бы применить в данном случае RL, но благодаря пониманию задачи мы можем привязать награду к нужному действию с помощью lookahead - заглядыванию в будущее при расчёте награды каждого показа. Не 100% надёжно, но близко.
Если у каждого действия есть конкретная награда, то при некотором предположении мы можем отказаться от "долгосрочного" RL-планирования и решать задачу с помощью Supervised Learning - по векторам фичей пользователя и товара предсказывать награду, и потом по предсказанию ранжировать в проде.
Это предположение - независимость пользовательского состояния от наших действий - не совсем верно, но такая декомпозиция позволяет нам радикально уменьшить шумность обучения, а при ограниченных данных это важно.
@knowledge_accumulator
Post #21
785
- 👍 5