🔒 Эмоциональное: Пытался запустить алгоритм еще с момента неофициального кода, и уже 2 недели ковырялся в коде и...
🔄 Вышел официальный код Tune-A-Video, позволяющий создавать text2video с референс видео INFO—PAPER—GITHUB—DEMO(только, если арендуете A100 на HF)
🔄 Коротко как работает: Разбираем видео на кадры, затем дообучаем на этих кадрах нужную SD модель
(Да-да, ваши Dreambooth модельки спокойно прикручиваются), вытаскиваем кадры с новым промптом. Тем самым есть запоминание движения и персонажей, при этом окружение и стилистику можно менять! На данный момент это не продакшн генерации, а вот мемов понаделать, уууух
😐 По ресурсам: Требуется больше 24 гб памяти для обучения модельки, в среднем 512x512 8 кадров видео файнтюнится за 10 минут(!)
А на превью сделал танец в разных стилистиках, и как же я рад, что спустя 2 недели появился адекватный результат генераций.