Сбер научил нейросети «понимать» время при генерации видео с помощью Time Adapter 📰
Команда Kandinsky представила лёгкую надстройку, которая управляет динамикой событий и частотой кадров в генеративных роликах. Она решает одну из главных проблему видеогенерации — модели могут ошибаться в передаче естественной скорости процессов, из-за чего быстрые движения растягиваются, а медленные замирают или идут рывками.
Модуль состоит из двух независимых блоков и обучен на датасете из 40 тысяч видео с разной динамикой — от бега и танцев до тумана и дождя. Научная статья о подходе была представлена на ICML.
Как устроены режимы работы:
➡️Подключение к готовой модели: адаптер делает движения плавнее, не меняя общий характер генерации.
➡️Совместное дообучение: модель (например, Kandinsky 5.0 Video Lite) меняет физику сцены и учится генерировать недоступные ранее процессы. При этом естественность движения выросла на 29%, визуальное качество — на 8%, а точность следования промпту — на 19%.
Решение бесплатно как для личного, так и для коммерческого использования, исходный код опубликован на Hugging Face под открытой лицензией MIT.
Post #1696
591
- 🔥 5
- 😢 1