Всем привет!🔥
📆 Сегодня (23.01) в 17:00 Дмитрий Поярков расскажет про:
Основные подходы для комбинации оффлайн и онлайн обучения в RL
Объединение оффлайн и онлайн обучения нейросетевых моделей позволяют объединить сильные стороны двух подходов.
⚫️Оффлайн-обучение эффективно использует накопленные данные, но склонно к переобучению и потому теряет надёжность при смене условий.
⚫️Онлайн-обучение, действуя в режиме непрерывного взаимодействия со средой, вырабатывает более устойчивые стратегии, однако требует существенно больших ресурсов и времени.
Совмещение этих режимов даёт шанс ускорить обучение и повысить надёжность стратегий, однако является нетривиальной задачей. На встрече поговорим об основных проблемах в реализации данной идеи и ключевых методах борьбы с ними.
Статьи:
1. Training Language Models to Follow Instructions with Human Feedback
2. WARP: On the Benefits of Weight Averaged Rewarded Policies
3. PIRLNav: Pretraining with Imitation and RL Finetuning for ObjectNav
4. AWAC: Accelerating Online Reinforcement Learning with Offline Datasets
5. Playing Atari Games with Deep Reinforcement Learning and Human Checkpoint Replay
🍿Ссылка на подключение
Подписаться⤵️
Embodied AI Reading Club
Post #59
1.23K

- 🔥 12