Всем привет!🔥
📆 Завтра (03.04) в 17:00 Татьяна Земскова разберет статью
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
представленную на NeurIPS 2025, в которой предлагается модель на основе VLA для решения задачи манипуляции, использующая прогнозирование знаний о мире (динамические области пространства, глубину и семантическую сегментацию).
Авторы используют связку «восприятие → прогнозирование → действие», используя блочный механизм внимания для разделения типов знаний, что позволяет роботу формировать абстрактные представления о среде перед планированием движений.
Эксперименты демонстрируют высокое качество решения задачи манипуляции: 76.7% SR на реальном роботе и 4.44 средней длины выполнения на бенчмарке CALVIN ABC-D, подтверждая эффективность подхода как в симуляции, так и в реальных условиях.
Ссылки:
1. DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
2. Код к статье
🍿Ссылка на подключение
Подписаться⤵️
Embodied AI Reading Club
Post #65
1.61K

- ❤ 4
- 👍 3
- 🔥 3