TGViewer
Mashkka про Data Science Mashkka про Data Science @mashkka_ds · 5.21K subscribers
Post #3825 803

Forwarded from Dendi Math&AI (Денис Димитров)

🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших моделей генерации видео, теперь с синхронным звуком!

🎬 Video Lite — 3B параметров, акцент сделали на эффективности модели и доступности запуска
🎬 Video Pro — 29B параметров, это флагман с лучшим качеством следования промпту, качеством визуала и динамики

Обе модели понимают мультиязычные запросы и генерируют видео (режим text-to-video) или «оживляют» изображения (режим image-to-video). Разрешение видео — вплоть до FullHD с помощью нашей модели апскейла Kandinsky SR 2.0 Video. Модели поддерживают создание видео до 5 секунд с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью

⚡️ Про качество

Модель Kandinsky 5.0 Video Pro более полугода занимала первое место среди открытых моделей в задаче text-to-video на arena.ai и была сопоставима по визуальному качеству с Veo 3. По нашим side-by-side сравнениям флагман новой линейки — Kandinsky 6.0 Video Pro — заметно превосходит Kandinsky 5.0 Video Pro по визуальному качеству, реалистичности движения и следованию запросу и показывает качество на уровне Veo 3.1 Fast. А среди открытых моделей Kandinsky 6.0 Video Pro уступает только MiniMax H3, достигая паритета с LTX 2.5. Больше сравнений и деталей — в техрепорте (кстати, буду рад апвоутам статьи, сейчас мы уже традиционно #1 Paper of the day)

🔧 Немного технических подробностей

🔘Для обучения мы подготовили 50 млн изображений, 20 млн видеосцен, 40 млн аудиотреков и 7 млн видео с синхронным аудио

🔘В основе моделей — CrossDiT с двумя башнями: видео и аудио, с bidirectional audio↔video cross-attention. Видеобашню мы инициализировали моделью Kandinsky 5.0 Video (Lite и Pro, соответственно), аудиобашню обучали сначала с нуля, а затем совместно с видеобашней на качественных видео с синхронным звуком

🔘SFT делали в два этапа: сначала улучшали визуальное качество, дообучая видеобашню с замороженной аудиобашней. Затем размораживали всю модель и совместно дообучали обе башни с фокусом на качество аудио, синхронизацию модальностей и качество липсинка. На обеих стадиях обучали отдельные модели для 11 доменов, а в конце супировали полученные компоненты, усредняя веса в одну модель

🔘Смогли завести RL: на нашем тесте доля ошибок в генерируемой речи (WER) снизилась с 23,5% до 12,4% у Pro и с 17,9% до 12,7% у Lite 💪

🔘Поработали и над ускорением: подготовили дистиллированные версии Lite и Pro с генерацией за 10 шагов. Использовали π-Flow с последующим adversarial-дообучением Sim-LADD. По нашим side-by-side сравнениям в режиме image-to-video дистиллированная Pro сохраняет качество на уровне полной версии, при этом работает быстрее: 402→175 секунд на 5-ти секундное видео для Pro и 157→98 секунд для Lite.

🔘Адаптировали и Lite, и Pro для запуска на на RTX 4090, 5060 Ti, 5080, 5090, PRO 6000

Полезные ссылки:

👉 Почитать подробнее: техрепорт
👉 Код и веса: GitHub, Hugging Face
👉 Модель уже доступна через FAL, Diffusers, ComfyUI, SGLang и vLLM-Omni
👉Больше о нашей команде, моделях и исследованиях — на сайте Kandinsky Lab

Попробовать модель Pro можно в ГигаЧат в разделе Видео. Делитесь своими генерациями и обратной связью 🙂

@dendi_math_ai
  • 🔥 5
  • ❤ 3
  • 👌 1
More from @mashkka_ds
  1. Oct 11, 2026🇦🇲#justaboutme Best of Armenia Подборка самых ярких мгновений из моей короткой поездки в…
  2. Oct 11, 2026✨ На выпускном Digital Teams Выпустила очередной поток Digital Teams, где я в мае вела лек…
  3. Oct 11, 2026Post #3837
  4. Oct 9, 2026Алиса, мы рядом! 💜💚
  5. Oct 9, 2026#пятничныемемасы
  6. Oct 9, 2026🤖Не Jev, а FRIDA-Decisions FRIDA-Decisions: @artyfishl поделился рецептом как в кратчайши…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →