🤖 StreamVLN — новый подход к Vision-Language Navigation
github.com/InternRobotics/StreamVLN
Модель генерирует действия по непрерывному видеопотоку в режиме online, ведя многоходовой диалог.
Базируется на LLaVA-Video, но расширена для совместного моделирования зрения, языка и действий.
Что делает StreamVLN интересным:
🔹 Принимает видеопоток → отвечает действиями и репликами в реальном времени
🔹 Обрабатывает длинные последовательности без перегрузки вычислений
🔹 Имеет два уровня памяти:
1) быстрая диалоговая память — sliding-window KV cache
2) медленная долговременная память — token pruning для экономии ресурсов
📌 Итог — агент, который может смотреть, понимать и действовать онлайн, сохраняя контекст без потерь скорости.
Репозиторий: github.com/InternRobotics/StreamVLN
Post #1656
1.81K

- ❤ 1