Нам важно не столько то, как мы обходим человека в среднем по всем играм, а то, как мы работаем в худшем случае - именно здесь и добивается прорыва Agent57, который обходит человека во всех 57 играх Atari.
Данный алгоритм - это модификация Never Give Up (NGU), со следующими изменениями:
1) Мы теперь учимся предсказывать отдельными нейросетями 2 вида награды - настоящую и исследовательскую (из NGU). А смешивать их уже будем во время применения, обозначим вес NGU-награды как
beta.2) Используется многорукий бандит, который для каждого воркера, собирающего данные, сэмплирует значения
beta и горизонт планирования (gamma). Таргетом для выбора этих значений является производительность в игре - набранная суммарная награда. У каждого воркера при этом есть своя неизменная "рандомизация" (
epsilon) - вероятность, с которой будет выбрано случайное действие во время применения.Такое кол-во степеней свободы позволяет системе адаптивно выбирать такой набор параметров, который помогает лучше всего обучаться в данный момент.
80 миллиардов кадров - и готово.
@knowledge_accumulator
