TGViewer
Neurohive Neurohive @neurohive · 5.19K subscribers
Post #1955 3.11K
LongLive-2.0 — 5B-модель генерирует минутное видео в 720p в реальном времени

Исследователи из NVIDIA опубликовали LongLive-2.0 — инфраструктуру для обучения и запуска моделей генерации длинных видео с использованием 4-битного квантования NVFP4. NVFP4 — собственный формат NVIDIA, нативно поддерживаемый на GPU архитектуры Blackwell (GB200), так что полное ускорение доступно только на этом железе. В исследовании сравнивается квантование BF16 и NVFP4. BF16 хранит каждое число в 16 битах, NVFP4 сжимает их до 4 бит, поэтому модель занимает меньше памяти и быстрее считает. Теоретически это должно снижать качество генерации, но авторы показывают, что на практике результаты почти не отличаются от BF16: 85.06 против 84.51 балла на VBench.

Wan2.2-TI2V-5B, дообученная с помощью LongLive-2.0, генерирует 720p-видео со скоростью 45.7 FPS. Предыдущие методы выдавали 20-25 FPS при разрешении 480p. Обучение ускорилось в 2.15 раза, инференс — в 1.84 раза, потребление видеопамяти упало с 35.4 до 19.4 ГБ по сравнению с BF16-версией. На бенчмарке VBench-Long модель заняла первое место по согласованности персонажей и фона на 60-секундных видео.

Три ключевых компонента делают это возможным. Balanced SP — каждый GPU обрабатывает свой временной фрагмент видео, балансируя нагрузку и убирая дублирование VAE-энкодинга. Это позволяет обучать модель на 64-секундных видео без выхода за пределы памяти. KV-кэш квантуется в NVFP4 прямо во время генерации, сжимаясь в 3.6 раза. Асинхронное декодирование запускает VAE на отдельном GPU параллельно с основной моделью, так что декодирование не замедляет общую генерацию.

Код, веса и датасеты доступны на GitHub и Hugging Face.

#Stateoftheart
  • 👍 5
  • 🔥 3
  • 💯 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →