Post #122
2.17K


🤖 Всё никак не добирался написать, но новость интересная и точно заслуживает вашего внимания. Недавно мы выложили в открытый доступ Kandinsky WM 1.0 — линейку генеративных моделей для Physical AI
Один из больших трендов сейчас — развитие Physical AI Foundational Models (FM), которые способны полноценно моделировать физический мир.
И многие сильные команды приходят к Physical AI FM именно через видеогенерацию. Это довольно естественный путь: обучаясь на видео, модель получает представление о движении, динамике и взаимодействии объектов. Следующий шаг — связать эту модель с действиями агента. Отсюда, в частности, вырастает направление World Action Models: моделей, которые связывают действия робота с тем, как вследствие этих действий изменится наблюдаемый мир (и, наоборот, как выбрать оптимальное действие робота в соответствии с наблюдаемым / предсказанным поведением мира, среды).
При этом сама видеогенерация постепенно становится частью более широких omni-моделей. Например, Cosmos 3 от NVIDIA умеет работать с текстом, изображениями, видео, звуком, действиями на вход и на выход и может использоваться для разных robotics задач. Atlas от World Labs работает с текстом, изображениями, видео и 3D и позволяет восстанавливать реальные сцены и строить на их основе симуляции.
Мы развиваем Kandinsky в том же направлении: используем накопленный опыт в видеогенерации, чтобы строить модели для роботов и беспилотников. Kandinsky WM 1.0 — наш первый открытый релиз в этом треке. Мы выложили open source три специализированные модели:
🚗 K5-AV (Autonomous Vehicle) для генерации автомобильных сцен,
🦾 K5-RO (Robotics) для генерации различных сцен манипуляции с предметами,
🌍 K5-PH (Physics) для генерации сцен со сложной физикой в целом: движением людей, протеканием процессов и взаимодействием объектов.
Все модели получены дообучением нашей базовой модели генерации видео Kandinsky-5 Video Lite (2B). Модели умеют генерировать 5 секунд видео по первому кадру и текстовому описанию (то есть работают в режиме I2V).
Разрабатывали эти модели мы в первую очередь для генерации синтетических данных для обучения других моделей — в основном VLA — которые управляют роботами и беспилотными авто. Особенно важны тут редкие сценарии: сцены ДТП, видео экстремальной погоды или кейсы с отказом оборудования. Собирать такие данные в реальности дорого, очень сложно, а иногда и просто небезопасно. С помощью генеративной модели такие данные можно получасть практически неограниченно. Но у такого подхода есть и обратная сторона: если VideoGen модель неправильно воспроизводит физику, то в обучающие данные для VLA попадут ошибки. К сожалению, такого рода галлюцинации характеры для всех современных VideoGen моделей, потому что при их обучении больше фокусируются на эстетическом (визуальном) качестве, чем на физической достоверности.
Улучшить физичность по сути можно 2 способами: добавляя больше данных со сложной динамикой в претрейн и используя различные приёмы на этапе alignment (например, RL с физическими reward-моделями). Претрейн у нас уже был фиксирован (Lite), поэтому мы фокусировались на alignment: cначала делали SFT на качественных данных каждого домена (AV, RO, PH). Затем — RL с хитрыми reward-моделями за физическую достоверность (подробности можно почитать в статье на хабр)
⚡️По бенчмаркам: на Physics-IQ Verified для модели K5-PH получили рост общего score 16,0 (Lite) → 25,8 (Lite SFT PH) → 30,8 (K5-PH). Бенчмарк проверяет, как модели в режиме генерации видео продолжают реальный физический эксперимент по первому кадру. Домены экспериментов: механика твёрдых тел, динамика жидкостей, оптика, термодинамика и магнетизм.
Модели сейчас тестим с коллегами из Центра робототехники (ребята в том числе помогали с обучающими данными для K5-RO) и с AIRI в рамках развития симулятора XSIM World.
Веса и код моделей выложены под открытой лицензией MIT.
Полезные ссылки:
👉 Хабр
👉 GitHub
👉 HuggingFace
@dendi_math_ai
Один из больших трендов сейчас — развитие Physical AI Foundational Models (FM), которые способны полноценно моделировать физический мир.
И многие сильные команды приходят к Physical AI FM именно через видеогенерацию. Это довольно естественный путь: обучаясь на видео, модель получает представление о движении, динамике и взаимодействии объектов. Следующий шаг — связать эту модель с действиями агента. Отсюда, в частности, вырастает направление World Action Models: моделей, которые связывают действия робота с тем, как вследствие этих действий изменится наблюдаемый мир (и, наоборот, как выбрать оптимальное действие робота в соответствии с наблюдаемым / предсказанным поведением мира, среды).
При этом сама видеогенерация постепенно становится частью более широких omni-моделей. Например, Cosmos 3 от NVIDIA умеет работать с текстом, изображениями, видео, звуком, действиями на вход и на выход и может использоваться для разных robotics задач. Atlas от World Labs работает с текстом, изображениями, видео и 3D и позволяет восстанавливать реальные сцены и строить на их основе симуляции.
Мы развиваем Kandinsky в том же направлении: используем накопленный опыт в видеогенерации, чтобы строить модели для роботов и беспилотников. Kandinsky WM 1.0 — наш первый открытый релиз в этом треке. Мы выложили open source три специализированные модели:
🚗 K5-AV (Autonomous Vehicle) для генерации автомобильных сцен,
🦾 K5-RO (Robotics) для генерации различных сцен манипуляции с предметами,
🌍 K5-PH (Physics) для генерации сцен со сложной физикой в целом: движением людей, протеканием процессов и взаимодействием объектов.
Все модели получены дообучением нашей базовой модели генерации видео Kandinsky-5 Video Lite (2B). Модели умеют генерировать 5 секунд видео по первому кадру и текстовому описанию (то есть работают в режиме I2V).
Разрабатывали эти модели мы в первую очередь для генерации синтетических данных для обучения других моделей — в основном VLA — которые управляют роботами и беспилотными авто. Особенно важны тут редкие сценарии: сцены ДТП, видео экстремальной погоды или кейсы с отказом оборудования. Собирать такие данные в реальности дорого, очень сложно, а иногда и просто небезопасно. С помощью генеративной модели такие данные можно получасть практически неограниченно. Но у такого подхода есть и обратная сторона: если VideoGen модель неправильно воспроизводит физику, то в обучающие данные для VLA попадут ошибки. К сожалению, такого рода галлюцинации характеры для всех современных VideoGen моделей, потому что при их обучении больше фокусируются на эстетическом (визуальном) качестве, чем на физической достоверности.
Улучшить физичность по сути можно 2 способами: добавляя больше данных со сложной динамикой в претрейн и используя различные приёмы на этапе alignment (например, RL с физическими reward-моделями). Претрейн у нас уже был фиксирован (Lite), поэтому мы фокусировались на alignment: cначала делали SFT на качественных данных каждого домена (AV, RO, PH). Затем — RL с хитрыми reward-моделями за физическую достоверность (подробности можно почитать в статье на хабр)
⚡️По бенчмаркам: на Physics-IQ Verified для модели K5-PH получили рост общего score 16,0 (Lite) → 25,8 (Lite SFT PH) → 30,8 (K5-PH). Бенчмарк проверяет, как модели в режиме генерации видео продолжают реальный физический эксперимент по первому кадру. Домены экспериментов: механика твёрдых тел, динамика жидкостей, оптика, термодинамика и магнетизм.
Модели сейчас тестим с коллегами из Центра робототехники (ребята в том числе помогали с обучающими данными для K5-RO) и с AIRI в рамках развития симулятора XSIM World.
Веса и код моделей выложены под открытой лицензией MIT.
Полезные ссылки:
👉 Хабр
👉 GitHub
👉 HuggingFace
@dendi_math_ai
- 🔥 18
- 👏 6
- ❤🔥 5
- ❤ 1
- 🫡 1
- 😎 1







