Unsupervised-to-Online Reinforcement Learning
проблема смены распределения - очень неприятна в классическом супервайзд лернинге, а если дело доходит и до рл: Oh Lord, our redemption. Be our protection. Direct our minds by your gracious presence.
такое принято называйть оффлайн-ту-онлайн рл: обучали на оффлайн датасете, пора и дотюнить на онлайн данных. но это чревато обычно резким сбросом в результате в самом начале тюнинга, будто можно было и не пробовать претренить (подробнее об этом можете чекнуть здесь)
но Seohong Park & Co. решили пересмотреть парадигму: давайте тюнить в более классическом для мл сетапе ансупервайзд алгоритмы. супер! а как такое получить в рл и почему это может быть выгоднее?
- да так просто легче в долгосроке, получаем одну претрен ансупервайзд модель, которую можно тюнить на многие-многие сингл онлайн таски
- интуитивно внутренние репрезентации ансупервайзд метода лучше чем сингл-таск оффлайн метода в силу ограниченности покрытия датасета пространств + ограниченности по таске. как заверяют авторы, даже ограниченность оффлайн датасета несильно мешает ансупервайзд моделям осуществлять фит латентного пространства состояний
- да и потому что Seohong Park дальше протягивает свою идею (которая действительно хороша)
окей, что же взять за основу ансупервайзд метода? сота на данный момент - HILP (мы писали про него здесь, а еще кстати можете прочитать про это), который способен понять про многие скиллы в непрерывном латентном пространстве
далее это все смещается в сторону онлайн рл в 2 этапа
1. находится “латентный скилл”, который больше всего соответствует downstream таске при помощи реварда (еще конечно встает вопрос о доступности такого ревард датасета в реальных сценариях, особенно тогда, когда используют ансупервайзд модель в силу (возможного) отсутствия ревардов)
2. рескейлятся реварды онлайн и ансупервайзд датасетов (тут делали z-нормализацию), чтобы обучение точно шло по-честному и не было доп нестабильностей. под ансупервайзд ревардом подразумевается intrinsic reward, который склоняет агента двигаться во всех направлениях в латентном пространстве состояний
ну и вроде есть неплохое улучшение во многих энвах, только кода нет :)))))
вообще идея выглядит супер интересно и свежо + сдвигает рл все больше и больше в сторону нлп и св областей в плане инсайтов насчет претрена и скрытых репрезентаций + все больше витает в воздухе ощущение о необходимости фаундейшн моделей в обучении с подкреплением
👀LINK
Post #498
420



- ❤ 4