Kandinsky 6.0 Video — новая линейка моделей генерации видео со звуком🤙
Сбер представил новую версию Kandinsky и сразу открыл код и веса под MIT. Модель умеет генерировать не только видео, но и синхронный звук: диалоги, музыку и звуки окружения, а движения губ подстраиваются под речь.
Предыдущая версия Kandinsky больше полугода держала первое место среди открытых text-to-video моделей на arena.ai, сравнявшись по качеству с Veo 3. Новая Pro-версия уже на уровне Veo 3.1 Audio. Среди открытых моделей её опережает только MiniMax H3, а с LTX 2.5 она идёт вровень.
Веса моделей доступны на Hugging Face, код — на GitHub и на Gitverse. Опубликован подробный технический отчёт.
Модель можно использовать через Diffusers, ComfyUI и другие инструменты, а бесплатно попробовать — в ГигаЧате.
Post #23616
22.6K


- 👍 42
- 😁 27
- ❤ 10
- 🫡 7
- 😭 5
- 👏 4
- 🌭 4