🤯 Вышло интересное исследование про Vision-Language-Action (VLA) модели - это ИИ, который позволяет роботу видеть объект, понимать задачу и действовать (например, схватить предмет).
Обычно для этого нужны огромные модели и дорогие GPU.
Но тут сделали иначе 👇
Команда разработала модель, где почти все вычисления сведены к 3 значениям:
-1, 0 и 1
Да, буквально.
За счёт этого:
- модель сжали до ~1.4GB
- убрали сложную математику
- сделали её пригодной для дешёвого железа
👉 точность осталась на уровне больших моделей
👉 скорость выросла в 4 раза
То есть робот двигается так же точно, но быстрее и дешевле:
- больше не нужны дорогие серверы и GPU
- роботов можно запускать прямо на локальных чипах
- открывается путь к массовой роботизации (дешёвой)
Paper Link – arxiv.org/abs/2506.07530
Post #1774
2.13K

- ❤ 6
- 🤩 4
- 🔥 3