Напомню, что у RL-алгоритмов ключевое препятствие на пути к успеху - это необходимое количество данных для его обучения. Это фундаментальное ограничение задачи, но это не значит, что мы в него упираемся текущими алгоритмами.
Агент в ходе взаимодействия со средой получает огромное количество информации - цепочки состояний, действий и наград из среды. Эффективность "усвоения" этой информации зависит от самого алгоритма. Я уже писал про EfficientZero - призёра по обучению на Atari за 100к шагов. Сегодня я расскажу об альтернативном подходе, который потом лёг в основу первого места в этой таблице.
По сути, SPR - это хак, дополняющий произвольный RL-алгоритм. Он регуляризует модель, заставляя её выучивать представления, имеющие предсказательную силу внутри собранных цепочек состояний-действий.
Берём энкодер - первые слои нашей RL-сети (
s -> z), модель перехода (z_t, a_t -> z_t+1) (это новая нейросеть), проекция (z ->g) (это первый MLP-слой у RL-сети) и доп. слой q (я не понял, зачем он). Применяем это следующим образом:Берём K+1 последовательных состояний/действий. Кодируем первое в
z_0, далее с помощью модели перехода генерируем z_1, ..., z_k+1. В то же время энкодером кодируем "таргет"-представления из K последующих состояний и учим на косинусную близость проекций между таргетами и тем, что получено с помощью модели перехода. Иллюстрация на картинке.У этого алгоритма очень много деталей реализации. Дата-аугментации, "таргет"-энкодер, в общей сложности 40 гиперпараметров, занимающие почти целую страницу. Но у авторов получилось затюнить его до вменяемого состояния и получить наилучший на тот момент алгоритм.
Вновь мы видим проблемы ручного дизайна алгоритмов - зависимость результатов от гиперпараметров огромная, при этом их оптимальные значения зависимы друг от друга и их совместный подбор сильно напоминает чёрную магию.
В следующих постах разберём, как всё это легло в основу текущего лидера в Atari100k.
@knowledge_accumulator
