🏭 Google DeepMind и Nvidia делают ставку на world models — системы, которые учатся на видео и данных роботов, чтобы действовать в реальном мире.
Идея: такие модели могут открыть дорогу к масштабной робототехнике и интерактивным медиа. Потенциал оценивают в $100 трлн, если машины научатся понимать и работать с физическим окружением.
Что это такое
World models сжимают поток кадров, действий и результатов в состояние, которое умеет предсказывать следующее событие и выбирать действия, согласованные с физикой. Это отличие от LLM, которые сильны в тексте, но слабы в динамике контактов и сил.
Ключевые проекты
- Genie 3 (DeepMind) — пошаговая генерация видео, где будущее меняется в зависимости от действий агента
- V-JEPA — предсказание недостающих признаков в видео без меток, уже тестируется на роботах
- World Labs (Fei-Fei Li) и Runway — создание интерактивных 3D-сцен с пониманием объектов, света и движения
- Niantic — 10 млн локаций, оцифрованных игроками Pokémon Go (30 млн человек в месяц)
- Nvidia Omniverse — симуляции заводов и роботов для безопасной тренировки с переносом в реальный мир
Почему это сложно:
- долгосрочные предсказания без «дрейфа»
- реалистичное моделирование контактов и жидкостей
- гигантские вычисления для миллионов симуляций
Источник: ft.com/content/ae1c6de2-691e-448d-8bf3-8837cc1e6efb
Post #555
44