TGViewer
Complete AI Complete AI @complete_ai · 7.86K subscribers
Post #934 573

Forwarded from Dendi Math&AI (Денис Димитров)

🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших моделей генерации видео, теперь с синхронным звуком!

🎬 Video Lite — 3B параметров, акцент сделали на эффективности модели и доступности запуска
🎬 Video Pro — 29B параметров, это флагман с лучшим качеством следования промпту, качеством визуала и динамики

Обе модели понимают мультиязычные запросы и генерируют видео (режим text-to-video) или «оживляют» изображения (режим image-to-video). Разрешение видео — вплоть до FullHD с помощью нашей модели апскейла Kandinsky SR 2.0 Video. Модели поддерживают создание видео до 5 секунд с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью

⚡️ Про качество

Модель Kandinsky 5.0 Video Pro более полугода занимала первое место среди открытых моделей в задаче text-to-video на arena.ai и была сопоставима по визуальному качеству с Veo 3. По нашим side-by-side сравнениям флагман новой линейки — Kandinsky 6.0 Video Pro — заметно превосходит Kandinsky 5.0 Video Pro по визуальному качеству, реалистичности движения и следованию запросу и показывает качество на уровне Veo 3.1 Fast. А среди открытых моделей Kandinsky 6.0 Video Pro уступает только MiniMax H3, достигая паритета с LTX 2.5. Больше сравнений и деталей — в техрепорте (кстати, буду рад апвоутам статьи, сейчас мы уже традиционно #1 Paper of the day)

🔧 Немного технических подробностей

🔘Для обучения мы подготовили 50 млн изображений, 20 млн видеосцен, 40 млн аудиотреков и 7 млн видео с синхронным аудио

🔘В основе моделей — CrossDiT с двумя башнями: видео и аудио, с bidirectional audio↔video cross-attention. Видеобашню мы инициализировали моделью Kandinsky 5.0 Video (Lite и Pro, соответственно), аудиобашню обучали сначала с нуля, а затем совместно с видеобашней на качественных видео с синхронным звуком

🔘SFT делали в два этапа: сначала улучшали визуальное качество, дообучая видеобашню с замороженной аудиобашней. Затем размораживали всю модель и совместно дообучали обе башни с фокусом на качество аудио, синхронизацию модальностей и качество липсинка. На обеих стадиях обучали отдельные модели для 11 доменов, а в конце супировали полученные компоненты, усредняя веса в одну модель

🔘Смогли завести RL: на нашем тесте доля ошибок в генерируемой речи (WER) снизилась с 23,5% до 12,4% у Pro и с 17,9% до 12,7% у Lite 💪

🔘Поработали и над ускорением: подготовили дистиллированные версии Lite и Pro с генерацией за 10 шагов. Использовали π-Flow с последующим adversarial-дообучением Sim-LADD. По нашим side-by-side сравнениям в режиме image-to-video дистиллированная Pro сохраняет качество на уровне полной версии, при этом работает быстрее: 402→175 секунд на 5-ти секундное видео для Pro и 157→98 секунд для Lite.

🔘Адаптировали и Lite, и Pro для запуска на на RTX 4090, 5060 Ti, 5080, 5090, PRO 6000

Полезные ссылки:

👉 Почитать подробнее: техрепорт
👉 Код и веса: GitHub, Hugging Face
👉 Модель уже доступна через FAL, Diffusers, ComfyUI, SGLang и vLLM-Omni
👉Больше о нашей команде, моделях и исследованиях — на сайте Kandinsky Lab

Попробовать модель Pro можно в ГигаЧат в разделе Видео. Делитесь своими генерациями и обратной связью 🙂

@dendi_math_ai
  • ❤ 14
  • 👏 7
  • 🔥 5
  • ⚡ 1
More from @complete_ai
  1. Sep 17, 2026AI + разработка — Senior-разработчиков ждут в Ozon Tech В компании развивается новое напра…
  2. Sep 7, 2026Мы выложили программу Practical ML Conf 2026 Я уже не первый год состою в программном коми…
  3. Sep 5, 2026Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯 В сети разошлась табл…
  4. Aug 20, 202617 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, р…
  5. Aug 20, 2026Сегодня вечером мы вместе с Денисом Макрушиным встретимся на стриме и разгоним базу про бе…
  6. Aug 14, 2026🔥 GLM-5.3 от Z.ai — главное за 30 секунд: Чистый post-training. Та же базовая модель —GLM…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →