Сбер выпустил Kandinsky 6.0 Video для генерации видео со звуком 🔝
Это первая российская линейка моделей с синхронной генерацией видеоряда и аудио: речью с lip-sync, музыкой и звуками окружения. Предыдущая версия Kandinsky больше полугода удерживала первое место среди открытых text-to-video моделей на arena.ai, а новая Pro-версия уже находится на уровне Veo 3.1 Audio — среди открытых решений её опережает только MiniMax H3, а с LTX 2.5 она идёт вровень.
Линейка включает две модели разного размера и бесплатна для разработчиков и пользователей:
➡️Video Pro (29 млрд параметров): флагманская модель создаёт пятисекундные ролики по тексту и изображению. Поддерживает форматы 16:9, 9:16 и 1:1, а модель видео-апскейла увеличивает разрешение до Full HD.
➡️Video Lite (3 млрд параметров): компактная версия с той же архитектурой, адаптированная для запуска на потребительских видеокартах NVIDIA от RTX 5060 Ti до 5090.
Kandinsky 6.0 Video поддерживает запуск в Diffusers, ComfyUI, FastVideo, SGLang и vLLM-omni, а также доступна бесплатно в ГигаЧате в разделе генерации видео.
➡️ Подробный технический отчёт читайте по ссылке.
Веса моделей на Hugging Face, код — на GitHub и GitVerse.
Post #1701
246
- 😁 2