TGViewer
Neurohive Neurohive @neurohive · 5.19K subscribers
Post #1967 4.41K
TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря замене LLM на BERT

Исследователи из Хуачжунского университета науки и технологий и Huawei опубликовали TurboVLA - компактную vision-language-action модель, которая выдаёт действия для робота за 31.2 мс на RTX 4090 и набирает 97.7% на бенчмарке для роботов LIBERO. Главное отличие от других VLA в том, что внутри нет LLM. Вместо неё лёгкий текстовый энкодер BERT, а картинка и инструкция обмениваются информацией напрямую через модуль кросс-внимания. Отсюда 0.2B параметров вместо миллиардов и меньше 1 ГБ видеопамяти на инференсе.

Обычно VLA-модели устроены так: робот получает картинку с камеры и текстовую инструкцию по типу «сложи три миски друг на друга». Визуальные признаки сначала проецируются в пространство токенов языковой модели, склеиваются с токенами инструкции, прогоняются через модель, и уже из её скрытых состояний декодируются действия. Этот путь обозначается как V → L → A: сначала зрение, затем язык, потом действие. Ключевое наблюдение исследователей простое: если в инструкции уже написано, что делать, то от текста нужно только подсказать, на какие визуальные детали смотреть. Вместо V → L → A авторы предлагают прямое отображение V + L → A. Картинки и инструкция кодируются независимо, потом обмениваются информацией напрямую, минуя большую языковую модель. За один прямой проход модель выдаёт сразу чанк из 12 шагов управления.

Результаты на бенчмарке для роботов LIBERO: TurboVLA набирает 97.7% в среднем при 0.2B параметров, 0.9 ГБ видеопамяти и 31.2 мс задержки. Для сравнения, модель π0.5 выдаёт 96.9% при 3.4B параметров, 12.8 ГБ и 93.6 мс. VLA-JEPA набирает 97.2% при 2.8B и 108.7 мс, CogVLA 97.4% при 8.3B и 115.5 мс. Среди лёгких моделей Evo-1 даёт 94.8% при 0.8B, VLA-Adapter 97.3% при 1.5B. На реальном роботе AgileX Piper модель проверили на четырёх задачах (взять валик, отодвинуть карту, нажать степлер, сложить три миски) и получила от 80% до 92.5% success rate, в каждой из них обойдя π0.5.

Симуляционную часть можно воспроизвести целиком: обучение и тесты шли на открытых датасетах LIBERO и RoboTwin 2.0 (для версии под RoboTwin брали визуальный энкодер побольше, там 0.4B параметров). Собственные данные использовали только для дообучения под реального робота. TurboVLA рассчитана на конкретные инструкции. Если попросить робота «приготовить завтрак», разбивать это на шаги будет нечем.

Код модели доступен на GitHub под лицензией Apache-2.0, веса выложены на Hugging Face.

#Stateoftheart
  • ❤ 5
  • 👍 4
  • 🔥 3
  • ✍ 2
  • 👏 2
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →