🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших моделей генерации видео, теперь с синхронным звуком!
🎬 Video Lite — 3B параметров, акцент сделали на эффективности модели и доступности запуска
🎬 Video Pro — 29B параметров, это флагман с лучшим качеством следования промпту, качеством визуала и динамики
Обе модели понимают мультиязычные запросы и генерируют видео (режим text-to-video) или «оживляют» изображения (режим image-to-video). Разрешение видео — вплоть до FullHD с помощью нашей модели апскейла Kandinsky SR 2.0 Video. Модели поддерживают создание видео до 5 секунд с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью
⚡️ Про качество
Модель Kandinsky 5.0 Video Pro более полугода занимала первое место среди открытых моделей в задаче text-to-video на arena.ai и была сопоставима по визуальному качеству с Veo 3. По нашим side-by-side сравнениям флагман новой линейки — Kandinsky 6.0 Video Pro — заметно превосходит Kandinsky 5.0 Video Pro по визуальному качеству, реалистичности движения и следованию запросу и показывает качество на уровне Veo 3.1 Fast. А среди открытых моделей Kandinsky 6.0 Video Pro уступает только MiniMax H3, достигая паритета с LTX 2.5. Больше сравнений и деталей — в техрепорте (кстати, буду рад апвоутам статьи, сейчас мы уже традиционно #1 Paper of the day)
🔧 Немного технических подробностей
🔘Для обучения мы подготовили 50 млн изображений, 20 млн видеосцен, 40 млн аудиотреков и 7 млн видео с синхронным аудио
🔘В основе моделей — CrossDiT с двумя башнями: видео и аудио, с bidirectional audio↔video cross-attention. Видеобашню мы инициализировали моделью Kandinsky 5.0 Video (Lite и Pro, соответственно), аудиобашню обучали сначала с нуля, а затем совместно с видеобашней на качественных видео с синхронным звуком
🔘SFT делали в два этапа: сначала улучшали визуальное качество, дообучая видеобашню с замороженной аудиобашней. Затем размораживали всю модель и совместно дообучали обе башни с фокусом на качество аудио, синхронизацию модальностей и качество липсинка. На обеих стадиях обучали отдельные модели для 11 доменов, а в конце супировали полученные компоненты, усредняя веса в одну модель
🔘Смогли завести RL: на нашем тесте доля ошибок в генерируемой речи (WER) снизилась с 23,5% до 12,4% у Pro и с 17,9% до 12,7% у Lite 💪
🔘Поработали и над ускорением: подготовили дистиллированные версии Lite и Pro с генерацией за 10 шагов. Использовали π-Flow с последующим adversarial-дообучением Sim-LADD. По нашим side-by-side сравнениям в режиме image-to-video дистиллированная Pro сохраняет качество на уровне полной версии, при этом работает быстрее: 402→175 секунд на 5-ти секундное видео для Pro и 157→98 секунд для Lite.
🔘Адаптировали и Lite, и Pro для запуска на на RTX 4090, 5060 Ti, 5080, 5090, PRO 6000
Полезные ссылки:
👉 Почитать подробнее: техрепорт
👉 Код и веса: GitHub, Hugging Face
👉 Модель уже доступна через FAL, Diffusers, ComfyUI, SGLang и vLLM-Omni
👉Больше о нашей команде, моделях и исследованиях — на сайте Kandinsky Lab
Попробовать модель Pro можно в ГигаЧат в разделе Видео. Делитесь своими генерациями и обратной связью 🙂
@dendi_math_ai
Post #934
573