Добавлю в ленту технологических новостей. В январе-феврале 2026 заметен прогресс в развитии технологий генерации видео для различных физических сред, которые могут быть использованы как источник данных для обучения самых разных алгоритмов - от распознавания редких событий, генерации графов сцен, до управления роботами и беспилотными автомобилями.
Google DeepMind выкатила в конце января Project Genie (попробовать его можно тут), который объединил в себе возможности Genie 3, Nano Banana Pro and Gemini. Вот здесь можно посмотреть подробности: (блог)
Робототехнический стартап из Китая Robbyant, входящий в Ant Group (дочерняя компания Alibaba) выпустил в открытый доступ "модель мира" LingBot-World (проект) (код) (модель). Подробности можно также посмотреть в статье "Advancing Open-source World Models" (arxiv)
Вообще, Robbyant сделала релиз целой экосистемы полезных открытых инструментов и моделей для "физического ИИ", в которую вошли LingBot-Depth (фундаментальная модель для генерации высококачественных карт глубин по видео и разреженным облакам точек с сенсоров при 3D-восприятии пространства), LingBot-VA (модель генерации видео с действиями для управления роботами - авторы назвали это casual video-action world model), и собственно LingBot-VLA - "прагматическую" фундаментальную визуально-языковую модель генерации действий для 9 различных типов роботов.
#References
Post #387
365






- 🔥 3