TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #1033 1.19K
Horizon Reduction Makes RL Scalable

берклийцы сделали бенчмарк OGBench для goal-conditioned RL, где не смогли решить сложные таски → надо что-то изменить, но что? сначала попробовали просто обучаться на бОльшем датасете и в принципе масштабироваться, как делали это в других областях, что решало проблему
We also note that our 1B-sized datasets contain about 1M trajectories and 10M atomic behaviors in manipulation environments, which is similar or even larger than one of the largest robotics datasets to date


но не помогло, сколько экспериментов ни проводи → авторы вспоминают, что эти таски сложны из-за бОльшего горизонта достижения цели, на котором сложнее фиттить value функцию из-за смещенности таргета (по построению) и актора в том числе, ибо стейты сложнее матчить с оптимальными действиями

и здесь авторы стакают много рабочих идей, чтобы заработало:
- добавляют иерархичность в модели (state → subgoal → action), потому что она позволяет размыть удлиненный горизонт решения таски на 2 уровня: на каждом из уровне горизонт получается короче
- политики (high- & low-level как здесь в роботике) обучаются в behavior-cloning стиле на флоу матчинге
- на базе n-step sarsa, но с high-level policy получается SHARSA + есть еще вариант Double SHARSA, где семплируют несколько аутпутов не только у верхне-, но еще и у нижнеуровневой модели
- а Q-функции еще и допом обучаются через кросс энтропию (бинарную, а не другую)

в принципе статью можно считать полезной по экспериментальной базе, где (по их заверениям) эти идеи в комбинации улучшают результат, однако вопросы вызывает пункт в аппендиксе, где авторы пробовали прикрутить трансформер к short-horizon методам → как так получилось, что введение размерности времени в архитектуру не меняет ее перформанс относительно задачи с длинным горизонтом

👀 paper, code
  • ❤ 3
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →