TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #81 182
HIQL: Offline Goal-Conditioned RL with Latent States as Actions

Есть рл, где мы отталкиваемся от ревард функции. Окей, а что делать если этой функции нет - можно ли все равно делать роботов и прочее, что мы хотим? Yes, можно свести отсутствие реварда к задаче достижения цели (goal), где надо прийти в какое-то место, а ревард функция в данном случае будет индикатором того, достигли ли мы желаемой точки или нет. В каком-то смысле отсутствие реварда в явном виде подталкивает нас на то, что такие модели будут склонны к self-supervised (unsupervised) поведению

Но чем дальше наша цель, тем сложнее. Верно как и для людей, так и для универсальных аппроксиматоров (нейронок), Seohong Park, ранее упоминавшийся в нашем канале, решает эту проблему через обобщенную Value function, которая принимает на вход вместо действий так называемые подцели (subgoals) + вводит иерархичного актора (policy), первый уровень которого моделирует эмбеддинг этого subgoal, а второй уровень по действию и по подцели предсказывает действие, которое надо сделать чтобы прийти к изначальному goal

Звучит не так сложно, а ведь так и должно - зачастую скейлятся и остаются на года именно те решения, которые стараются как можно проще решить задачу, и при этом решают ее

👀LINK

#rl #goal #rewardfree #value #offlinerl
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →