Learning to Act without Actions
модели Комьютерного зрения и нлп получили большой буст благодаря огромным датасетам, которые можно получить из открытых источников для ансурервайзд целей.
А как быть области рл, где мы очень подвязаны на разметку - какое действие в каком состоянии привело в такой-то награде. Возможно ли что-то получить полезное из датасетов, огромных по размеру, но без действий и наград?
Авторы показывают, что можем!! Главное аккуратно ввести понятие латентного (скрытого) действия, и моделировать его целым рядом моделей:
- моделью динамики среды - при данном состоянии и действии моделируем следующее действие
- моделью обратной динамики - по последовательным состояниям предсказываем, какое действие привело к последнему состоянию
- сама политика, которая моделирует латентные действия + декодер по возможности, который маппит из латентных в непосредственные действия (если есть разметка для этого)
Ну в принципе звучит не так-то сложно, а вполне естественно. Так почему успешные результаты пришли только сейчас? Пушто если мы будем обучать эти модели наивно, то вместо "латентного действия" они будут выдавать стейты на тех или иных таймстепах по закону наименьшего сопротивления в минимизации лоссов. Поэтому авторы так же добавили квантизацию векторов латентов + расширили контекст у моделей динамик и поиграли с операциями стопградиента в них
👀LINK
#rl #latentactions #pretraining #foundationmodels #worldmodel
Post #109
180

