HIQL: Offline Goal-Conditioned RL with Latent States as Actions
Есть рл, где мы отталкиваемся от ревард функции. Окей, а что делать если этой функции нет - можно ли все равно делать роботов и прочее, что мы хотим? Yes, можно свести отсутствие реварда к задаче достижения цели (goal), где надо прийти в какое-то место, а ревард функция в данном случае будет индикатором того, достигли ли мы желаемой точки или нет. В каком-то смысле отсутствие реварда в явном виде подталкивает нас на то, что такие модели будут склонны к self-supervised (unsupervised) поведению
Но чем дальше наша цель, тем сложнее. Верно как и для людей, так и для универсальных аппроксиматоров (нейронок), Seohong Park, ранее упоминавшийся в нашем канале, решает эту проблему через обобщенную Value function, которая принимает на вход вместо действий так называемые подцели (subgoals) + вводит иерархичного актора (policy), первый уровень которого моделирует эмбеддинг этого subgoal, а второй уровень по действию и по подцели предсказывает действие, которое надо сделать чтобы прийти к изначальному goal
Звучит не так сложно, а ведь так и должно - зачастую скейлятся и остаются на года именно те решения, которые стараются как можно проще решить задачу, и при этом решают ее
👀LINK
#rl #goal #rewardfree #value #offlinerl
Post #81
182
