Сбер представил новую линейку моделей Kandinsky 6.0 Video. Это первая российская нейросеть с синхронной генерацией видео и звука: речь с lip-sync, музыка и звуки окружения.
Предыдущая версия Kandinsky больше полугода держала первое место среди открытых text-to-video моделей на arena.ai, сравнявшись по качеству с Veo 3. Новая Pro-версия уже на уровне Veo 3.1 Audio. Среди открытых моделей её опережает только MiniMax H3, а с LTX 2.5 она идёт вровень.
😎
🤩 Video Pro на 29 млрд параметров
Флагманская модель создаёт пятисекундные ролики и работает с текстом и изображением. ИИ умеет генерировать видео в форматах 16:9, 9:16 и 1:1, а модель видео-апскейла увеличивает разрешение до Full HD
🤩 Video Lite на 3 млрд параметров
Компактная версия с той же архитектурой, адаптирована для запуска на потребительских видеокартах NVIDIA: от RTX 5060 Ti до 5090
Веса моделей доступны на Hugging Face, код — на GitHub 🤩
Опубликован подробный технический отчёт с описанием архитектуры, данных, процесса обучения и результатов тестирования 🤩
Kandinsky 6.0 Video поддерживает запуск в Diffusers, ComfyUI, FastVideo, SGLang и vLLM-omni. Модель можно попробовать бесплатно в ГигаЧате в разделе генерации видео.
✔️ Подписывайтесь на Sber AI в МАКС

