Всем привет!
Завтра (25 октября ) в 16:00 Никита Качаев расскажет про:
Эффективный Online RL с использованием offline данных
Рассмотрим, как использование предварительно неразмеченных offline данных может ускорить exploration и повысить sample efficiency для off-policy алгоритмов в задачах с разреженными вознаграждениями, а также обсудим подходы к объединению онлайн и офлайн обучения без введения дополнительных регуляризаций с использованием on-policy алгоритмов
Статьи:
1. Accelerating Exploration with Unlabeled Prior Data
2. Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization
Ссылка на подключение будет позже
Post #741
689
Forwarded from Embodied AI Reading Club
- 🔥 7
- 👍 1