TGViewer
INCUBE.AI | Нейросети и не только INCUBE.AI | Нейросети и не только @incubeai_pro · 14.6K subscribers
Post #3465 673
NVIDIA и Университет Ватерлоо представили мультимодальную модель PixelUMM, которая совмещает понимание визуального контента и его генерацию. Она работает с фото, видео и текстом, отвечает в текстовом формате и сама создаёт изображения или ролики прямо в сырых пикселях — без VAE и отдельного визуального энкодера.

В качестве языковой основы используется Qwen3-8B, однако полный чекпоинт насчитывает 15,2 млрд параметров из-за отдельных экспертов для понимания и генерации, объединённых общим вниманием. Такая архитектура даёт возможность взять входное изображение как основу и продолжить его в видеоряд: на визуализации авторов в первой колонке показан исходный кадр, а последующие кадры сгенерированы моделью.

Веса доступны только для некоммерческих исследований и оценки по лицензии NVIDIA One-Way, а код в основном опубликован под Apache 2.0 вместе с заимствованным модулем под CC BY-NC.

INCUBE.AI | ПОДПИСАТЬСЯ
  • ❤ 6
  • 👍 1
  • 🔥 1
More from @incubeai_pro
  1. Oct 4, 2026Нанимаем бесплатных ИИ-коллег: вышел OpenDots — открытый аналог Dots от OpenAI. Агентам мо…
  2. Oct 4, 2026В работе Claude стало сложнее упустить важные детали — Anthropic специально выпустили для…
  3. Oct 4, 2026Выжимаем МАКСИМУМ из ChatGPT — OpenAI выпустила подробный гайд по промптингу и передаче за…
  4. Oct 4, 2026Отличный курс по Claude опубликовали на GitHub Модули идут от простых запросов к более сло…
  5. Oct 4, 2026Безумие: DOOM запустили прямо внутри SQL-базы данных Разработчик Лукас Фогель собрал SQLDo…
  6. Oct 4, 2026DeepSeek выпустила Harness для macOS и Windows По сути, это открытая альтернатива Claude C…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →