TGViewer
Neurohive Neurohive @neurohive · 5.17K subscribers
Post #1973 1.99K
Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS

Tsinghua University и Shengshu Technology представили две видеомодели, с помощью которых можно создать цифровой аватар и провести с ним видеозвонок или запустить стрим, а видеопоток редактировать в реальном времени. И все это в 720p при 25–42 FPS. Есть и режим без трансляции: загружаете фотографию и аудиодорожку, получаете готовый ролик, где аватар проговаривает текст по сценарию.

Vidu S2-Avatar на основе одной фотографии создает цифровой аватар: он произносит поданную аудиодорожку, меняет выражение лица, переводит взгляд, жестикулирует и выполняет текстовые или голосовые команды, вплоть до танца. Поток не ограничен по длине. Новую опорную картинку можно подать в любой момент прямо посреди трансляции: показали кружку – персонаж берёт её в руку, показали пиджак – надевает его, подали пляж – уходит из комнаты и оказывается на пляже.

Vidu S2-Editing редактирует видеопоток в реалтайме по текстовой инструкции и опорной картинке: перекрашивает ролик в другой стиль, переодевает человека в кадре, заменяет его другим персонажем или подменяет фон. Движение и тайминг исходника сохраняются кадр в кадр. Редактировать можно и то, что человек видит через камеру VR-шлема - результат обе модели отдают в том числе стереопарой для VR.

Разрешение выросло с 540p у предыдущей версии Vidu S1 до 720p при 25–42 FPS. На StreamAV-Bench модель показала лучший результат по всем девяти метриках. На тесте виртуальной примерки ViViD метрика VFID упала до 9.95 против 19.51 у прежнего лидера, а в слепых парных сравнениях оценщики предпочли Vidu S2-Avatar конкурентам в 85.7–100% случаев.

Модели доступны в веб-приложении и по API. Генерация Vidu S2-Avatar в реалтайме стоит примерно 45 центов за минуту или $27 за час непрерывной трансляции. Клонирование голоса обойдется в $4.5 за голос, первые 10 голосов бесплатно. Новым пользователям при регистрации начисляются пробные кредиты.

#Stateoftheart
  • 🔥 9
  • 👍 4
  • 🤗 2
  • 🤩 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  3. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  4. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  5. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
  6. Aug 3, 2026TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря заме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →