Supervised Pretraining Can Learn In-Context Reinforcement Learning
А возможна ли какая-то теория, которая объясняет, как же все-таки работает ин-контекст лернинг, а конкретнее ин-контекст лернинг в рл, потому что это не совсем то же, что и инконтекст в нлп
Так вот, возможна. Авторы придумали как обучать и евалить трансформер, что он с точки зрения теории является эффективной имплементацией Байесовского постериорного семплинга.
А как такое достигается? В чем особенность алгоритма? Во время обучения трансформер учат предсказывать оптимальное действие (которое может быть получено оракулом или чем-либо еще) для фиксированного состояния, которое мы помещаем в начало последовательности, а остальная (основная) часть последовательности - случайный контекст.
Что это значит? - тренировочный датасет собирается случайной равномерной политикой - у действий одинаковая вероятность, с которой ее могут засемплить. Таким образом в контекст вбиваются элементы эксплорейшна относительно реварда и динамики среды (для кучи-кучи разных тасок) + мы подаем это на вход трансформеру не в последовательном виде, а случайном. Получаем расширение вариативности контекста на двух уровнях
Окэй, допустим. А как такой трансформер евалить? Да в принципе как обычно, за исключением того, что, судя по оригинальной имплементации, во время евала в качестве контекста хранится 1 предыдущий эпизод, никак не связываясь с текущим эпизодом (кроме потока стейтов для которых предиктим действия)
Это нетривиально имхо, поскольку AD и S5 плавно обрабатывают входящие сигналы мульти-эпизодичного контекста. Еще одна важная разница заключается в том, что DPT умеет решать только MDP, о POMDP речи не идет вообще
Вот такую цену заплатили авторы, чтобы получить крутой теоретически обоснованный алгоритм🥸
👀LINK
Post #143
352


- 🔥 6
- 👍 4
- ❤ 3