Latent Action Learning Requires Supervision in the Presence of Distractors
ресерч в области латентных действий это круто, ибо на еще один шажочек приближает методы рл к более реалистичным use case’ам - потому беркли до этого формализовали классические формулы под латентное пространство, а дипмаинд не сделали бы ворлд модели без них (гени и гени2, в оазисе наверняка без латентных действий тоже не обошлось)
ну и здесь авторы еще подвинули этот вопрос поближе к практическому сценарию - где есть много шума (отвлекающего фактора, нерелевантного для процесса принятия решений) принятый сообществом LAPO начинает работать супер плохо
- VQ квантизатор в таком сетапе начинает давать сбои (хотя изначально интуитивно он и помогал обучаться вычленению латентных действий вместо простых транзиций между обсервейшнами) → nahooy его
- обратная модель динамики теперь принимает не текущий обсервейшн и последующий, но и принадлежащий из окна в K таймстепов (потому что это молодежно, К = 10 достаточно для distracting DMC)
- всякий стафф по гиперпараметрам (латентная размерность действий 128 → 8192 etc.)
- теперь еще и модели динамики (прямая и обратная) оперируют в латентном пространстве, пытаясь восстановить не обсервейшн, а состояние. так и обучаться быстрее из соображений памяти + сетки попроще можно делать (в этом случае свертки просто заменяются на млп)
в общем и целом так. назвали LAOM. и хоть нехило так обгоняет лапу по качеству (на базе этих моделей надстраивать классику для максимизации награды + линейная проба под ground-truth действия), без дообучения на настоящие действия все не так сладко
но тем не менее и тут тоже есть + в том, что если раньше нужно было примерно 10% истинных действий, то здесь появляется показатель в 2.5%
👀 link, видео от авторов
Post #812
496





- 🔥 5
- ❤ 3