TGViewer
Neurohive Neurohive @neurohive · 5.16K subscribers
Post #1968 4.23K
JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одной B200

Команда Joy Future Academy представила JoyAI-Video-Edit — открытую авторегрессионную диффузионную модель на 16B параметров для редактирования видео в реальном времени. Модель обрабатывает кадры по текстовому промпту по мере их поступления, без доступа к будущим кадрам и не зная длину ролика. Полный сквозной пайплайн выдаёт 30.19 FPS в разрешении 720×1280 на одной Nvidia B200.

JoyAI-Video-Edit умеет менять фон, стиль (акварель, масло, мультфильм), добавлять, удалять и заменять объекты и людей в кадре, менять одежду и внешность, изменять движения персонажей и объектов. Отдельно поддерживается редактирование по референсной картинке, когда одежда или предмет с фотографии переносится на человека в видео. Всё это работает поверх исходного ролика, оставляя без изменений движения, композицию и те области видеопотока, которые менять не просили.

Архитектура модели состоит из энкодера условий на базе MLLM, каузального видео-VAE и мультимодального диффузионного трансформера. Итеративный денойзинг сжат до двух шагов методом Source-Anchored DMD, который привязывает учителя к синхронному фрагменту исходного видео и не даёт картинке отходить от оригинала на длинных потоках.

Результаты: на бенчмарке OpenVE-Bench модель набирает 3.60 балла против 2.62 у SANA-Streaming и 1.87 у XMax-X2.0, что сопоставимо по качеству с офлайн-редакторами Kling-3.0 Omni (3.64) и Bernini-R (3.72). На минутных видео из LongV2VBench — 3.30 против 1.71 у ближайшего конкурента. В попарной человеческой оценке JoyAI-Video-Edit выигрывает у потоковых редакторов в 81–90% случаев.

Код инференса выложен на GitHub, веса - на Hugging Face под лицензией Apache 2.0.

#Stateoftheart
  • 🔥 12
  • 👍 2
  • ❤ 1
  • 👏 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 3, 2026TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря заме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →