Reinforcement Learning from Passive Data via Latent Intentions
yo, мы ранее говорили, что абсолютное большинство доступных данных не содержат разметку на действия, да и с такими данными работают в goal-conditioning стиле
Но что если ребята из беркли придумали, как свести goal-conditioning rl к стандартному рл, не имея при этом разметку на реварды и действия? (то есть расширить понятие функций ценностей - value functions)
Вопрос с единственно возможным ответом хе-хе. Да! Такое смогли сделать и это просто охренительно - с сырыми данными мы используем этот фреймворк и получаем осмысленное представление состояний, политик и потенциальных исходов в среде просто по демонстрациям, необработанным в смысле рльки
Достигают они этого с помощью введения латентных действий, называемых интенциями, и соединяют это с ревард функцией, которая стимулирует дойти до заранее определенной цели, используя конкретную интенцию. Сложно (непонятно), но интересно и изменений от стандартного рл не так много, что они сразу смогли некоторые алгоритмы подогнать под их фреймворк и получается все оч круто
👀LINK
#rl #valuenetwork #goalconditioning #latentactions #latentrewards
Post #129
299


- 👍 1