Почему? Объясняет Евгений Михайленко, руководитель бизнеса и продукта Physical AI «Яндекс Роботикс».
Японская корпорация Fujitsu объявила о разработке технологии spatial world model.
Система анализирует, как люди, роботы и объекты взаимодействуют, и предсказывает, что они могут сделать дальше. Вместо обработки «сырых» пикселей с камер spatial world model строит сцену, где люди, роботы, предметы находятся как связный набор сущностей. Это позволяет понимать пространство даже в динамике, при перемещениях и изменении угла зрения.
Такие системы могут быть полезны в разных сферах бизнеса — от промышленности до ритейла и логистики.
«В отличие от моделей вроде text-to-video, которые часто опираются на “кинематографическое” представление о мире и могут генерировать физически неверные сцены, world models пытаются моделировать именно реальную физику и причинность. Это как раз то, чего традиционно не хватало роботам.
Например, способность понимать, что если перевернуть стакан с водой — вода действительно выльется, а не зависнет в воздухе, и место, в которое она выльется, станет мокрым. То есть модель должна не просто видеть картинку, а предсказывать изменения состояния мира.
Сейчас многие команды активно экспериментируют с world models, и направление уже показывает первые рабочие результаты, но технология всё ещё находится на раннем этапе. Серьёзных универсальных решений пока нет. Не потому что идея слабая, а потому что полноценные физически правдоподобные world models начали появляться совсем недавно и требуют огромных мультимодальных датасетов и вычислений.
Возможно, у Fujitsu действительно получилось продвинуться дальше других. Корпорация недавно представила свою spatial world model и обещает раскрыть детали в начале следующего года. За этим точно стоит внимательно следить», — отмечает Евгений Михайленко, руководитель бизнеса и продукта Physical AI «Яндекс Роботикс».
Подписывайтесь 👉 @ya_robotics