TGViewer
Метаверсище и ИИще Метаверсище и ИИще @cgevent · 52.7K subscribers
Post #16822 2.73K
Ну, за аватаров.

Tavus показала Griffin - новый real-time AI-аватар, который уже выглядит не как очередная “говорящая фотография”, а как попытка генерировать целиком живого собеседника во время разговора.

Спойлер, про слепые тесты Туринга в конце.

Griffin получает вашу речь и видео, продолжает слушать и смотреть на вас даже в тот момент, когда отвечает сам, а параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр виртуального кожаного. То есть он умеет не только синхронно шевелить губами, но и кивнуть во время вашей фразы, отвести взгляд, отреагировать выражением лица, вставить короткую реплику или остановиться, когда его перебили.

Причём это, внимание, real-time генерация, а не заранее сделанный ролик.

Видеочасть Griffin-Lite работает в 720p при 25 fps. Модель генерирует видео кусками по 320 ms: один latent = 8 кадров. На каждый такой кусок приходится всего 3 diffusion steps, после чего он сразу декодируется и отправляется зрителю на том конце. Средняя задержка от входящего аудио до соответствующей реакции в видео в тестах Tavus составляет 0.43 секунды на NVIDIA H100.

Но здесь важная оговорка: из этого не следует, что весь Griffin “работает с latency 430 ms”. В полном разговорном тесте NVIDIA медианная реакция Griffin была около 1.9-2.2 секунды в зависимости от задачи. 0.43 секунды - именно latency видеогенератора после поступления управляющего аудиосигнала.

По железу Tavus раскрывает только часть картины. Именно тест видеогенератора проводился на H100. В credits компания отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview, но сколько GPU требуется на одну сессию и на каких именно конфигурациях работает весь Griffin, Tavus пока не сообщает. Поэтому утверждать, что “один Griffin = один H100”, нельзя.

И попробовать всё это тоже, блин, пока нельзя.

Конкуренты.

Google неделю назад выпустила Gemini 3.8 Live with Live Avatar. Писал про это недавно. Это тоже настоящий потоковый аватар: Gemini одновременно получает аудио и изображение с камеры, ведёт native speech-to-speech диалог и генерирует синхронного аватара в 24 fps. Он видит камеру и screen sharing, поддерживает 97 языков и tool calling прямо во время разговора. Live Avatar уже доступен в Gemini Enterprise, хотя создание собственного аватара по фотографии пока требует allowlist.

Runway Characters идёт немного с другой стороны. Из одной картинки можно сделать real-time персонажа с голосом и характером, который разговаривает через WebRTC, может видеть webcam и screen share. В Runway уже можно попробовать это самому: веб-версия ограничивает разговор двумя минутами, API - пятью минутами, цена самого Characters сейчас составляет 2 кредита за 6 секунд, то есть около $0.20 за минуту. Причём Runway позволяет вообще принести свой STT + LLM + TTS, а Characters использовать только как real-time видеослой.

А Vidu S2-Avatar вообще уже продаётся как полноценная streaming-модель. Она принимает изображение персонажа и ведёт real-time голосовой диалог, поддерживает interruption, управление движениями, а во время разговора ей можно дать фотографию предмета, одежды или нового фона - персонаж может взять предмет, переодеться или изменить окружение прямо в потоке. У S2 есть публичный demo и API.

То есть сам факт “живого аватара в реальном времени” уже не мегафича. Google это делает, Runway это делает, Vidu это делает.

Интерес Griffin скорее в другом: Tavus пытается связать понимание разговора и генерацию невербального(!!!) поведения гораздо теснее. Видео здесь должно быть не просто визуализацией уже готового аудио. Разговорная модель отдельно управляет gesture, gaze, emotion и может менять их уже в следующем 320-ms куске видео.

Зато Tavus уже неистово хайпуют: “первая модель, прошедшая video Turing test”.

54 человека посадили на минутный видеозвонок. Им сказали, что сейчас их соединят с другим участником исследования. На самом деле напротив кожаных сидел Griffin-Lite, который в реальном времени генерировал лицо, голос и ответы.

После звонка 26 из 54 человек - 48% - сказали, что разговаривали с настоящим человеком. Для предыдущей версии Tavus результат был 1 из 41.

Вот эти 48% Tavus и называет прохождением video Turing test. Штош.

Строго говоря, никакого общепринятого стандарта “video Turing test” не существует, а эксперимент был крохотным и ещё немного подталкивал кожаных в нужную сторону: им изначально сказали, что они встретятся с другим человеком, а вопрос про ИИ появился только после разговора.

Но результаты всё равно нарядные.

Почти половина кожаных в условно слепом тесте просто не заметила, что напротив них вообще нет кожаного.

И, наверное, именно поэтому Tavus пока не даёт Griffin всем желающим. Представляю, какое количество мошеннических схем можно замутить с таким видосом.

Но вы мысленно готовьтесь жить в новом мире. Где вообще никому и ничему нельзя верить не то что на слово, а и на глаз.

https://www.tavus.io/

https://research.nvidia.com/labs/amri/projects/video-fdb/
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://help.runwayml.com/hc/en-us/articles/49557780326163-Runway-Charactershttps://s.vidu.com/vidu-stream/

@cgevent
www.tavus.io Tavus: The Human Computing Company Personified Application Layers that see, hear, and respond face-to-face in real time. Build and deploy with our API, no-code PAL Maker, or enterprise Solutions. Interactive AI avatars and conversational video reimagined
  • 🔥 9
  • ❤ 3
  • 🙏 1
More from @cgevent
  1. Oct 2, 2026Я тут закрыл гештальт с Google Colabом и двумястами часами свободного доступа к A100. Дума…
  2. Oct 2, 2026Ну, за аватаров из предыдущего поста. ⬆️⬆️⬆️⬆️⬆️⬆️⬆️
  3. Oct 2, 2026Довольно давно художники начали использовать смартфон для записи движения камеры внутри 3D…
  4. Oct 2, 2026Suno бахнуло Speech Олды вспомнили про Bark Теперь оно генерирует не только пестни, но и о…
  5. Oct 2, 2026Объяснятор по Госту После написания предыдущего поста мне, конечно, стало интересно, как э…
  6. Oct 2, 2026Офигенный новый пост от Андрея Карпатого. Грех его не разобрать. Потому что, наверное, мно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →