In-Context Imitation Learning
via Next-Token Prediction
мы уже ни раз упоминали про такую хайповую область, как ин-контекст рл.
и теперь авторы из беркли и не только смогли расширить ее до применения в роботике, то есть в реальном мире (а не только в джакс средах хехе)
только тут это не ин-контекст рл, а ин-контекст имитейшн лернинг. в трейн датасете 29 комплексных тасок, которые состоят из 6 примитивных и собирались человеком, на евале таски составлялись из 3 примитивных
общий пайплайн примерно напоминает то, что уже было: в качестве контекста берется несколько траекторий, ргб картинки + проприоцепция обрабатываются как разные модальности, делаем пулинг с аттеншном и получаем что-то типа state. скармливаем последовательность вместе с действиями и обучаем в классике next-token prediction: predict a_t+1 given (s_1, a_1, s_2, a_2… s_t-1, a_t-1, s_t). разве что сигнала реварда нет, потому что это имитейшн лернинг
серьезная разница есть так же и во время инференса - в качестве “системного промпта” подаются трейн траектории на других комплексных тасках, чтобы агент не улетел на новой тестовой в накопление ошибки, которое так часто встречается в IL. и этот интересный инсайт работает, что прикольно
ждем скейла по ускорению работы трансформера (как и здесь) + скейла по тому, чтобы была генерализация на неизвестные прежде примитивные таски (что сложнее, ибо наверняка придется повышать их количество до порядка, сравнимого с порядком трейновых тасок для ин-контекст рл методов - сотни и тысячи)
👀LINK
Post #490
501



