Сбер выпустил новую линейку генеративных моделей Kandinsky 5.0 в open source — с кодом, весами и под лицензией MIT
Линейку представили на международной конференции Сбера - AI Journey. В нее вошли нейросети:
– Video Pro - превосходит Wan2.2-A14B и работает на уровне Veo 3 по визуалу и динамике. Генерирует видео в HD длиной до 10 секунд с гибким контролем движения камеры
– Video Lite - оптимизирована для пользовательских GPU от 12 ГБ VRAM и значительно превосходит в 7 раз большую Wan2.1-14B по качеству генерации в Text-2-Video и Image-2-Video
– Image Lite - превосходит FLUX.1 [dev] по Text-to-Image и в паритете с FLUX.1 Kontext [dev] по Image Editing
Модели Video Pro и Image Lite понимают английские и русские запросы, способны генерировать надписи на кириллице и латинице, обучены на большом количестве данных и дополнительно доучены на сверхкачественном, специальным образом отобранном датасете, а также оптимизированы для запуска.
Все модели можно найти на GitHub, Gitverse и HuggingFace. Технический репорт лежит по ссылке.
Post #10018
9.4K


- 🔥 71
- 💩 44
- 🎉 7
- 👍 5
- 🤔 5
- 💋 3
- 🥴 2
- 🍓 1