«Сбер» создал ИИ-модель Kandinsky 6.0 Video для создания видео с синхронным звуком
Генерация видео доступна в форматах SD, HD или Full HD, в то время как звук создается в стандартном для стриминговых сервисов качестве 44 кГц. Максимальная длительность ролика со звуком составляет пять секунд.
Пользователи 🏷GigaChat могут работать с моделью через текстовое описание сцены или загрузку первого кадра с уточнением деталей звукового ряда. Референсы на незнакомые объекты из запроса Kandinsky 6.0 Video ищет самостоятельно.
По сообщению «Сбера», новая модель точнее передает физику реального мира по сравнению с предыдущей версией. Модель выложена в Open Source под лицензией MIT, позволяющей интегрировать ее в продукты бесплатно.
👉🏻 Репозиторий на Hugging Face
🔗 Источник: https://www.forbes.ru/tekhnologii/569706-sber-predstavil-novuu-ii-model-kandinsky-6-0-dla-sozdania-video-so-zvukom
***
📎 В сентябре 2026 года команда Kandinsky разработала надстройку Time Adapter для генеративных нейросетей, которая позволяет им «понимать» течение времени при формировании видеоряда.
Post #227347
234
Forwarded from База знаний AI