Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS
Tsinghua University и Shengshu Technology представили две видеомодели, с помощью которых можно создать цифровой аватар и провести с ним видеозвонок или запустить стрим, а видеопоток редактировать в реальном времени. И все это в 720p при 25–42 FPS. Есть и режим без трансляции: загружаете фотографию и аудиодорожку, получаете готовый ролик, где аватар проговаривает текст по сценарию.
Vidu S2-Avatar на основе одной фотографии создает цифровой аватар: он произносит поданную аудиодорожку, меняет выражение лица, переводит взгляд, жестикулирует и выполняет текстовые или голосовые команды, вплоть до танца. Поток не ограничен по длине. Новую опорную картинку можно подать в любой момент прямо посреди трансляции: показали кружку – персонаж берёт её в руку, показали пиджак – надевает его, подали пляж – уходит из комнаты и оказывается на пляже.
Vidu S2-Editing редактирует видеопоток в реалтайме по текстовой инструкции и опорной картинке: перекрашивает ролик в другой стиль, переодевает человека в кадре, заменяет его другим персонажем или подменяет фон. Движение и тайминг исходника сохраняются кадр в кадр. Редактировать можно и то, что человек видит через камеру VR-шлема - результат обе модели отдают в том числе стереопарой для VR.
Разрешение выросло с 540p у предыдущей версии Vidu S1 до 720p при 25–42 FPS. На StreamAV-Bench модель показала лучший результат по всем девяти метриках. На тесте виртуальной примерки ViViD метрика VFID упала до 9.95 против 19.51 у прежнего лидера, а в слепых парных сравнениях оценщики предпочли Vidu S2-Avatar конкурентам в 85.7–100% случаев.
Модели доступны в веб-приложении и по API. Генерация Vidu S2-Avatar в реалтайме стоит примерно 45 центов за минуту или $27 за час непрерывной трансляции. Клонирование голоса обойдется в $4.5 за голос, первые 10 голосов бесплатно. Новым пользователям при регистрации начисляются пробные кредиты.
#Stateoftheart
Post #1973
1.99K
- 🔥 9
- 👍 4
- 🤗 2
- 🤩 1