JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одной B200
Команда Joy Future Academy представила JoyAI-Video-Edit — открытую авторегрессионную диффузионную модель на 16B параметров для редактирования видео в реальном времени. Модель обрабатывает кадры по текстовому промпту по мере их поступления, без доступа к будущим кадрам и не зная длину ролика. Полный сквозной пайплайн выдаёт 30.19 FPS в разрешении 720×1280 на одной Nvidia B200.
JoyAI-Video-Edit умеет менять фон, стиль (акварель, масло, мультфильм), добавлять, удалять и заменять объекты и людей в кадре, менять одежду и внешность, изменять движения персонажей и объектов. Отдельно поддерживается редактирование по референсной картинке, когда одежда или предмет с фотографии переносится на человека в видео. Всё это работает поверх исходного ролика, оставляя без изменений движения, композицию и те области видеопотока, которые менять не просили.
Архитектура модели состоит из энкодера условий на базе MLLM, каузального видео-VAE и мультимодального диффузионного трансформера. Итеративный денойзинг сжат до двух шагов методом Source-Anchored DMD, который привязывает учителя к синхронному фрагменту исходного видео и не даёт картинке отходить от оригинала на длинных потоках.
Результаты: на бенчмарке OpenVE-Bench модель набирает 3.60 балла против 2.62 у SANA-Streaming и 1.87 у XMax-X2.0, что сопоставимо по качеству с офлайн-редакторами Kling-3.0 Omni (3.64) и Bernini-R (3.72). На минутных видео из LongV2VBench — 3.30 против 1.71 у ближайшего конкурента. В попарной человеческой оценке JoyAI-Video-Edit выигрывает у потоковых редакторов в 81–90% случаев.
Код инференса выложен на GitHub, веса - на Hugging Face под лицензией Apache 2.0.
#Stateoftheart
Post #1968
4.23K
- 🔥 12
- 👍 2
- ❤ 1
- 👏 1