Экстраординарные утверждения требуют экстраординарных доказательств
Продолжаем разговор про RL-рекомендации, начавшийся тут.
Чтобы доказать, что RL-алгоритм выполняет поставленную задачу - максимизирует ту награду, которую мы задаём в процессе обучения, нужно проводить аккуратный ablation study.
Что я хочу в нём увидеть?
В RL есть параметр Gamma, отвечающий за горизонт планирования. Если он равен 1, то это значит, что мы максимизируем всю будущую награду, а если 0, то только ближайшую - это по сути как в Supervised learning. Обычно в обучении используют гамму, близкую к 1, но итоговый результат измеряют с помощью награды, просуммированной на всём промежутке (то есть как будто Gamma = 1).
Я хотел бы, чтобы авторы обучали и тестировали дополнительную версию своей модели с единственным изменением - с Gamma, равной 0. Это лучший способ доказать, что учитывание последующих наград действительно приносит пользу и использование RL имеет смысл.
Кроме того, важным бейзлайном может быть модель, которая учитывает долгосрочные награды, но только связанные только с совершённым действием напрямую. Например, мы берём порекомендованный товар и учитываем все его покупки в будущем, которые были совершены, в качестве таргета. Это проверяет предположение о том, что можно обойтись аккуратным расчётом таргета для классического рекомендательного алгоритма, а не мучиться с RL.
Я не помню, когда последний раз видел подобное аккуратное сравнение, если видел вообще. В подавляющем количестве работ RL-алгоритм сравнивается с алгоритмом, который отличается в 10 местах, и из этого сравнения невозможно сделать качественный вывод о том, что влияет на результат.
@knowledge_accumulator
Post #66
1.82K
- 👍 24
- 🔥 4
- 😁 2
- 🤔 2