Viggle внезапно вернулись с открытой моделью - и довольно бодрой.
Последний большой модельный апдейт у них был ещё 12 февраля, когда вышел Viggle V4. Теперь они бахают Viggle-Animate - причём впервые с весами и кодом.
Это замена персонажа на видео на базе MiniMax H3. Берём исходное видео, вытаскиваем из него один кадр, перерисовываем персонажа(никакого автомата нет, сами) в этом кадре типа в кота, самолёт или игрушку - и Viggle-Animate протягивает замену через весь ролик, сохраняя исходные движения, камеру и тайминг.
Самое интересное - практически выкинули традиционную обвязку.
Никаких pose skeleton, segmentation mask, face tracker, depth или текстового промпта на этапе видео. На входе только driving video + один переделанный(как-то) кадр.
Внутри это полноценный fine-tune 33.1B ref2va-трансформера MiniMax H3 плюс DMD2 LoRA. Дистилляция уменьшила процесс до 4 sampling steps, то есть фактически 3 forward passes.
Круто, что все используют Минимакс как стандарт теперь.
Побивает Wan2.2-Animate-14B по скорости в 6 раз.
Есть и ложка железа натощак.
BF16-версия весит 33B параметров, трансформер занимает около 62 GiB, а полный прогон пикует примерно в 80.1 GiB VRAM. То есть обычной 80 GB карты уже формально не хватает - рекомендуют 96 GB+ либо CPU offload. Viggle пишет, что у них модель работает и на RTX 5090 32 GB через NVFP4, но этот квант они пока не выложили.
Главная засада: модель не принимает обычный портрет персонажа. Reference должен быть именно кадром из исходного ролика, уже перерисованным под нужного персонажа. Такое мы видели у Рунвея два года назад.
Ссылки:
https://huggingface.co/Viggle/Viggle-Animate
https://viggle.ai/blog/viggle-animate-character-replacement-from-a-repainted-frame
https://viggle.ai/h3
https://viggle.ai/blog/everything-you-need-is-in-viggle-v4
@cgevent
@cgevent
Post #16510
7.84K
- 👍 22
- 🔥 8
- ❤ 4
- 👎 3
- 😁 3