TGViewer
Neurohive Neurohive @neurohive · 5.18K subscribers
Post #1960 3.25K
DreamX-World-5B: открытая модель генерации мира с контролем камеры, текстовым управлением и запоминанием локаций

Команда AMAP-ML опубликовала DreamX-World 1.0 — интерактивную генеративную модель мира, которая превращает текст или изображение в управляемое видео с точным контролем камеры, памятью о ранее посещённых сценах и поддержкой добавления событий по текстовым промптам. Модель работает в фотореалистичных, игровых и стилизованных визуальных доменах.

Исследователи дообучили базовую модель Wan2.2-TI2V поэтапно: сначала для управления камерой, затем для долгосрочной памяти о сцене, событийного управления и авторегрессивной генерации длинных видео. На восьми GPU RTX 5090 модель работает в реальном времени со скоростью до 16 FPS.

DreamX-World 1.0 — единственная публично доступная модель, поддерживающая все пять уровней управления действиями: реакцию на текстовые промпты, события на уровне отдельных объектов, привязку событий к области кадра, комбинирование нескольких сущностей в одной инструкции и взаимодействие между объектами. Конкуренты частично покрывают первые два-три уровня, но не дают полноценного управления несколькими взаимодействующими объектами одновременно.

DreamX-World с 5B параметров обгоняет модели большего размера по ключевым метрикам и при этом работает в реальном времени. В слепом исследовании предпочтений людей DreamX-World выигрывает у конкурентов: HY-WorldPlay (8B) в 57.5% случаев и у LingBot-World (14B) в 61.9% по общему впечатлению.

Моделирование мира — это комплексная задача: подготовка данных, поэтапное обучение, оценка и оптимизация инференса должны проектироваться вместе, а не отдельно друг от друга. Если решить только архитектурную часть и оставить медленный инференс, модель останется лабораторным прототипом, не пригодным для интерактивного использования. Если сосредоточиться только на скорости и забыть про память сцены, пользователь будет видеть, как окружение меняется при каждом повторном проходе, и ощущение «настоящего мира» пропадёт.

Веса модели доступны на Hugging Face, код на GitHub.

#Stateoftheart
  • 👍 5
  • ❤ 4
  • 🔥 1
  • 🤔 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →