EfficientZero [2021] - "data-эффективный" RL
Я давно обозначал проблему большинства методов RL - чудовищная требовательность к объёму данных в связи с необходимостью извлекать зависимости между наблюдениями в разных временных точках. Фундаментально от неё никуда не деться, если мы пытаемся учить общий RL-алгоритм на задаче с нуля, но на практике "data-эффективность" ухудшается ещё сильнее из-за несовершенства методов. Сегодня поговорим об EfficientZero - алгоритме, занимающим первое место в обучении играм Atari за 100к кадров обучения.
Алгоритм базируется на MuZero, про который я писал ранее. Этот метод обучает "модель" среды, но предсказывает не сами будущие состояния, а только будущие награды и действия самого же агента в следующих шагах. Это облегчает задачу и избавляет от ненужной задачи генерации следующего состояния. Далее по дереву этих подобий "состояния" (назовём их эмбеддингами состояния) делается поиск, как в AlphaZero. Обсудим улучшения, которые привели к победе над конкурентами.
1) Self-Supervised Consistency Loss
Это способ использовать информацию о будущем состоянии при обучении, не пытаясь его предсказать. У нас есть энкодер текущего состояния в эмбеддинг, а также сетка, которая по эмбеддингу предсказыват эмбеддинг на следующем шаге. Так вот, эта регуляризация требует, чтобы энкодер + переход от текущего состояния выдавал то же, что и энкодер от следующего. Вполне логичное требование.
2) Model-Based Off-Policy Correction
Используемый RL-метод изначально предполагает, что мы собираем данные какой-то стратегией, обновляем её и выбрасываем все данные на помойку. В связи с распределённой и асинхронной природой обучения метода на большом кластере, это нарушается, и в метод добавляются различные компенсирующие костыли. Идея этого в том, что на "предсказания будущего" агента опираются тем меньше, чем более "старая" траектория используется для обучения.
3) End-To-End Prediction of the Value Prefix
При подсчёте таргета используется предсказанная в будущем сумма наград на k шагов вперёд. Теперь мы предсказываем всю сумму одновременно, а не награды по отдельности, чтобы потом просуммировать.
Проще объяснить эти нововведения невозможно, к сожалению, за подробными объяснениями лучше обратиться к статье или обзору. Итоговый метод с очень большим отрывом побеждает всех остальных конкурентов, с чем авторов и поздравляем.
@knowledge_accumulator
Post #104
2.25K
- 👍 13
- 🔥 4
- ❤ 1