TGViewer
Dendi Math&AI Dendi Math&AI @dendi_math_ai · 3.03K subscribers
Post #122 2.18K
🤖 Всё никак не добирался написать, но новость интересная и точно заслуживает вашего внимания. Недавно мы выложили в открытый доступ Kandinsky WM 1.0 — линейку генеративных моделей для Physical AI

Один из больших трендов сейчас — развитие Physical AI Foundational Models (FM), которые способны полноценно моделировать физический мир.

И многие сильные команды приходят к Physical AI FM именно через видеогенерацию. Это довольно естественный путь: обучаясь на видео, модель получает представление о движении, динамике и взаимодействии объектов. Следующий шаг — связать эту модель с действиями агента. Отсюда, в частности, вырастает направление World Action Models: моделей, которые связывают действия робота с тем, как вследствие этих действий изменится наблюдаемый мир (и, наоборот, как выбрать оптимальное действие робота в соответствии с наблюдаемым / предсказанным поведением мира, среды).

При этом сама видеогенерация постепенно становится частью более широких omni-моделей. Например, Cosmos 3 от NVIDIA умеет работать с текстом, изображениями, видео, звуком, действиями на вход и на выход и может использоваться для разных robotics задач. Atlas от World Labs работает с текстом, изображениями, видео и 3D и позволяет восстанавливать реальные сцены и строить на их основе симуляции.

Мы развиваем Kandinsky в том же направлении: используем накопленный опыт в видеогенерации, чтобы строить модели для роботов и беспилотников. Kandinsky WM 1.0 — наш первый открытый релиз в этом треке. Мы выложили open source три специализированные модели:
🚗 K5-AV (Autonomous Vehicle) для генерации автомобильных сцен,
🦾 K5-RO (Robotics) для генерации различных сцен манипуляции с предметами,
🌍 K5-PH (Physics) для генерации сцен со сложной физикой в целом: движением людей, протеканием процессов и взаимодействием объектов.

Все модели получены дообучением нашей базовой модели генерации видео Kandinsky-5 Video Lite (2B). Модели умеют генерировать 5 секунд видео по первому кадру и текстовому описанию (то есть работают в режиме I2V).

Разрабатывали эти модели мы в первую очередь для генерации синтетических данных для обучения других моделей — в основном VLA — которые управляют роботами и беспилотными авто. Особенно важны тут редкие сценарии: сцены ДТП, видео экстремальной погоды или кейсы с отказом оборудования. Собирать такие данные в реальности дорого, очень сложно, а иногда и просто небезопасно. С помощью генеративной модели такие данные можно получасть практически неограниченно. Но у такого подхода есть и обратная сторона: если VideoGen модель неправильно воспроизводит физику, то в обучающие данные для VLA попадут ошибки. К сожалению, такого рода галлюцинации характеры для всех современных VideoGen моделей, потому что при их обучении больше фокусируются на эстетическом (визуальном) качестве, чем на физической достоверности.

Улучшить физичность по сути можно 2 способами: добавляя больше данных со сложной динамикой в претрейн и используя различные приёмы на этапе alignment (например, RL с физическими reward-моделями). Претрейн у нас уже был фиксирован (Lite), поэтому мы фокусировались на alignment: cначала делали SFT на качественных данных каждого домена (AV, RO, PH). Затем — RL с хитрыми reward-моделями за физическую достоверность (подробности можно почитать в статье на хабр)

⚡️По бенчмаркам: на Physics-IQ Verified для модели K5-PH получили рост общего score 16,0 (Lite) → 25,8 (Lite SFT PH) → 30,8 (K5-PH). Бенчмарк проверяет, как модели в режиме генерации видео продолжают реальный физический эксперимент по первому кадру. Домены экспериментов: механика твёрдых тел, динамика жидкостей, оптика, термодинамика и магнетизм.

Модели сейчас тестим с коллегами из Центра робототехники (ребята в том числе помогали с обучающими данными для K5-RO) и с AIRI в рамках развития симулятора XSIM World.

Веса и код моделей выложены под открытой лицензией MIT.
Полезные ссылки:
👉 Хабр
👉 GitHub
👉 HuggingFace

@dendi_math_ai
  • 🔥 18
  • 👏 6
  • ❤‍🔥 5
  • ❤ 1
  • 🫡 1
  • 😎 1
More from @dendi_math_ai
  1. Aug 6, 2026Курс по Visual GenAI от Yandex Research и ШАД Авторы CV Time не только пишут обзоры статей…
  2. May 28, 2026Сегодня в 12:00 продолжаем, но теперь онлайн: https://dion.vc/event/datafest-kb Программа…
  3. May 26, 2026Подключайтесь послушать: Секция GenAI Секция GenCV Вот тут программа
  4. Apr 30, 2026В этом году я организую секцию GenCV в рамках DataFest 2026. Будут интересные доклады: о м…
  5. Apr 29, 2026А вы знали, что методы генерации видео можно использовать для прогноза погоды? Наша команд…
  6. Mar 23, 2026Приглашаем на пятый Большой Семинар AIRI, который пройдёт 16 апреля в 17:00 ⤵️ Хотим подел…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →