Нейронки для создания видео не синтезируют ролики напрямую. Они это делают в токенизированном пространстве. Поэтому нужны токенизаторы: превращать видео в компактный набор чисел — токены
Новые открытые токенизаторы видео KVAE-2.0 от инженеров Kandinsky Lab превосходят по качеству генерации SOTA-модели — Wan 2.2 и HunyuanVideo 1.5 — как раз потому, что при их создании учитывали diffusability латентного пространства. Сжатие видео происходит по трём осям:
🤩 в 8 или 16 раз — по ширине
🤩 в 8 или 16 — по высоте
🤩 в 4 раза — по количеству кадров
И это далеко не всё, на что способна новая модель. В честной схватке с другими открытыми моделями она показала лучшие результаты:
🔆 Меньше артефактов
🔆 Высокая детализация лиц и текста
🔆 Гибкая память для работы с высокими разрешениями
Не знаем, как вы, а мы ушли тестировать!
✔️ Подписывайтесь на Sber AI в MAX
