Вышел Kandinsky 6.0 Video — новая линейка моделей от Сбера, которая генерирует видео с синхронным ЗВУКОМ.
Модели могут создавать видео с диалогами, музыкой и звуками окружения. При этом аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью.
Прошлая версия Kandinsky более полугода занимала первое место среди открытых моделей в категории text-to-video на arena.ai и рубилась наравне с Veo 3.
Новый флагман выдает результат на уровне Veo 3.1 Audio, а среди открытых моделей уступает только MiniMax H3, достигая паритета с LTX 2.5. Есть и версия Lite с 3 млрд параметров.
Веса моделей доступны на Hugging Face, код — на GitHub. Также опубликован подробный технический отчёт. А ещё можно тестить бесплатно в ГигаЧате.
@techmedia
Post #23551
9.45K


- 😁 43
- 👍 8
- 😭 4
- 🔥 2