H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning
Архитектура JEPA Яна Лекуна теперь стала иерархической. Напоминаем, основная идея в том, чтобы сделать модель, которая не угадывает следующий токен или пиксель, а понимает, что происходит в мире и что случится дальше (подробнее тут: https://t.me/data_secrets/8915).
В новой работе получилось сделать следующий важный шаг: JEPA научили нормально планировать на длинном горизонте. На Visual AntMaze (виртуальная среда для тестирования роботов в пространстве) новый подход поднял долю успешных прохождений с 18% до 73%, а затраты на планирование при этом сократились.
За иерархической версией архитектуры стоит довольно простая идея. Вместо одной world model используются несколько уровней с разным временным масштабом. Верхний уровень думает далеко вперед и выбирает примерное направление, следующий превращает его в более конкретные подцели, а нижний уже решает, какие действия нужно сделать прямо сейчас.
При этом верхние уровни сами учатся отбрасывать мелкие детали, которые не нужны для долгосрочного планирования. Например, в лабиринте на верхних уровнях пропадает информация о точном положении ног, но остается понимание, где находится робот и как устроен маршрут.
https://alphaxiv.org/abs/2610.06805
Post #10122
12.4K

- 😁 71
- ❤ 38
- 🔥 18
- 👍 10
- ☃ 2
- 🤔 2
- 🫡 2
- 👏 1
- 💯 1