Кайфули на каждый день
Авторы:
@zzmtsvv
@maxnygma (AI4Science посты)
Post #1033
1.19K








Horizon Reduction Makes RL Scalable
берклийцы сделали бенчмарк OGBench для goal-conditioned RL, где не смогли решить сложные таски → надо что-то изменить, но что? сначала попробовали просто обучаться на бОльшем датасете и в принципе масштабироваться, как делали это в других областях, что решало проблему
но не помогло, сколько экспериментов ни проводи → авторы вспоминают, что эти таски сложны из-за бОльшего горизонта достижения цели, на котором сложнее фиттить value функцию из-за смещенности таргета (по построению) и актора в том числе, ибо стейты сложнее матчить с оптимальными действиями
и здесь авторы стакают много рабочих идей, чтобы заработало:
- добавляют иерархичность в модели (state → subgoal → action), потому что она позволяет размыть удлиненный горизонт решения таски на 2 уровня: на каждом из уровне горизонт получается короче
- политики (high- & low-level как здесь в роботике) обучаются в behavior-cloning стиле на флоу матчинге
- на базе n-step sarsa, но с high-level policy получается SHARSA + есть еще вариант Double SHARSA, где семплируют несколько аутпутов не только у верхне-, но еще и у нижнеуровневой модели
- а Q-функции еще и допом обучаются через кросс энтропию (бинарную, а не другую)
в принципе статью можно считать полезной по экспериментальной базе, где (по их заверениям) эти идеи в комбинации улучшают результат, однако вопросы вызывает пункт в аппендиксе, где авторы пробовали прикрутить трансформер к short-horizon методам → как так получилось, что введение размерности времени в архитектуру не меняет ее перформанс относительно задачи с длинным горизонтом
👀 paper, code
берклийцы сделали бенчмарк OGBench для goal-conditioned RL, где не смогли решить сложные таски → надо что-то изменить, но что? сначала попробовали просто обучаться на бОльшем датасете и в принципе масштабироваться, как делали это в других областях, что решало проблему
We also note that our 1B-sized datasets contain about 1M trajectories and 10M atomic behaviors in manipulation environments, which is similar or even larger than one of the largest robotics datasets to date
но не помогло, сколько экспериментов ни проводи → авторы вспоминают, что эти таски сложны из-за бОльшего горизонта достижения цели, на котором сложнее фиттить value функцию из-за смещенности таргета (по построению) и актора в том числе, ибо стейты сложнее матчить с оптимальными действиями
и здесь авторы стакают много рабочих идей, чтобы заработало:
- добавляют иерархичность в модели (state → subgoal → action), потому что она позволяет размыть удлиненный горизонт решения таски на 2 уровня: на каждом из уровне горизонт получается короче
- политики (high- & low-level как здесь в роботике) обучаются в behavior-cloning стиле на флоу матчинге
- на базе n-step sarsa, но с high-level policy получается SHARSA + есть еще вариант Double SHARSA, где семплируют несколько аутпутов не только у верхне-, но еще и у нижнеуровневой модели
- а Q-функции еще и допом обучаются через кросс энтропию (бинарную, а не другую)
в принципе статью можно считать полезной по экспериментальной базе, где (по их заверениям) эти идеи в комбинации улучшают результат, однако вопросы вызывает пункт в аппендиксе, где авторы пробовали прикрутить трансформер к short-horizon методам → как так получилось, что введение размерности времени в архитектуру не меняет ее перформанс относительно задачи с длинным горизонтом
👀 paper, code
- ❤ 3












