NVIDIA и Университет Ватерлоо представили мультимодальную модель PixelUMM, которая совмещает понимание визуального контента и его генерацию. Она работает с фото, видео и текстом, отвечает в текстовом формате и сама создаёт изображения или ролики прямо в сырых пикселях — без VAE и отдельного визуального энкодера.
В качестве языковой основы используется Qwen3-8B, однако полный чекпоинт насчитывает 15,2 млрд параметров из-за отдельных экспертов для понимания и генерации, объединённых общим вниманием. Такая архитектура даёт возможность взять входное изображение как основу и продолжить его в видеоряд: на визуализации авторов в первой колонке показан исходный кадр, а последующие кадры сгенерированы моделью.
Веса доступны только для некоммерческих исследований и оценки по лицензии NVIDIA One-Way, а код в основном опубликован под Apache 2.0 вместе с заимствованным модулем под CC BY-NC.
INCUBE.AI | ПОДПИСАТЬСЯ
Post #3465
673

- ❤ 6
- 👍 1
- 🔥 1