TGViewer
Мальцев Репостит Мальцев Репостит @botforwardchannel · 175 subscribers
Post #116911 4
Ну, за аватаров.

Tavus показала Griffin - новый real-time AI-аватар, который уже выглядит не как очередная “говорящая фотография”, а как попытка генерировать целиком живого собеседника во время разговора.

Спойлер, про слепые тесты Туринга в конце.

Griffin получает вашу речь и видео, продолжает слушать и смотреть на вас даже в тот момент, когда отвечает сам, а параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр виртуального кожаного. То есть он умеет не только синхронно шевелить губами, но и кивнуть во время вашей фразы, отвести взгляд, отреагировать выражением лица, вставить короткую реплику или остановиться, когда его перебили.

Причём это, внимание, real-time генерация, а не заранее сделанный ролик.

Видеочасть Griffin-Lite работает в 720p при 25 fps. Модель генерирует видео кусками по 320 ms: один latent = 8 кадров. На каждый такой кусок приходится всего 3 diffusion steps, после чего он сразу декодируется и отправляется зрителю на том конце. Средняя задержка от входящего аудио до соответствующей реакции в видео в тестах Tavus составляет 0.43 секунды на NVIDIA H100.

Но здесь важная оговорка: из этого не следует, что весь Griffin “работает с latency 430 ms”. В полном разговорном тесте NVIDIA медианная реакция Griffin была около 1.9-2.2 секунды в зависимости от задачи. 0.43 секунды - именно latency видеогенератора после поступления управляющего аудиосигнала.

По железу Tavus раскрывает только часть картины. Именно тест видеогенератора проводился на H100. В credits компания отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview, но сколько GPU требуется на одну сессию и на каких именно конфигурациях работает весь Griffin, Tavus пока не сообщает. Поэтому утверждать, что “один Griffin = один H100”, нельзя.

И попробовать всё это тоже, блин, пока нельзя.

Конкуренты.

Google неделю назад выпустила Gemini 3.8 Live with Live Avatar. Писал про это недавно. Это тоже настоящий потоковый аватар: Gemini одновременно получает аудио и изображение с камеры, ведёт native speech-to-speech диалог и генерирует синхронного аватара в 24 fps. Он видит камеру и screen sharing, поддерживает 97 языков и tool calling прямо во время разговора. Live Avatar уже доступен в Gemini Enterprise, хотя создание собственного аватара по фотографии пока требует allowlist.

Runway Characters идёт немного с другой стороны. Из одной картинки можно сделать real-time персонажа с голосом и характером, который разговаривает через WebRTC, может видеть webcam и screen share. В Runway уже можно попробовать это самому: веб-версия ограничивает разговор двумя минутами, API - пятью минутами, цена самого Characters сейчас составляет 2 кредита за 6 секунд, то есть около $0.20 за минуту. Причём Runway позволяет вообще принести свой STT + LLM + TTS, а Characters использовать только как real-time видеослой.

А Vidu S2-Avatar вообще уже продаётся как полноценная streaming-модель. Она принимает изображение персонажа и ведёт real-time голосовой диалог, поддерживает interruption, управление движениями, а во время разговора ей можно дать фотографию предмета, одежды или нового фона - персонаж может взять предмет, переодеться или изменить окружение прямо в потоке. У S2 есть публичный demo и API.

То есть сам факт “живого аватара в реальном времени” уже не мегафича. Google это делает, Runway это делает, Vidu это делает.

Интерес Griffin скорее в другом: Tavus пытается связать понимание разговора и генерацию невербального(!!!) поведения гораздо теснее. Видео здесь должно быть не просто визуализацией уже готового аудио. Разговорная модель отдельно управляет gesture, gaze, emotion и может менять их уже в следующем 320-ms куске видео.

Зато Tavus уже неистово хайпуют: “первая модель, прошедшая video Turing test”.

54 человека посадили на минутный видеозвонок. Им сказали, что сейчас их соединят с другим участником исследования. На сам...
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto

Другие каналы по темам:
🤖 AI @maltsevdaily
🧑‍🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym
www.tavus.io Tavus: The Human Computing Company Personified Application Layers that see, hear, and respond face-to-face in real time. Build and deploy with our API, no-code PAL Maker, or enterprise Solutions. Interactive AI avatars and conversational video reimagined
More from @botforwardchannel
  1. Oct 2, 2026🚬 Длинное тире больше не выдаёт нейротекст: исследователи из Graphite обнаружили новые пр…
  2. Oct 2, 2026Ищу 4 тестировщиков новой версии Workshop AI 👀 Большое обновление готовится к релизу. Сей…
  3. Oct 2, 2026Кстати, по поводу размещения рекламы в ChatGPT Кто-то уже тестировал? Как вам? Вот тут мож…
  4. Oct 2, 2026Он маленький, ему страшно, но он справится 😊 === 💬Это пост из ленты, которую читает Саша…
  5. Oct 2, 2026#Однажды мы с хором пели в покоях Папы Иоанна Павла II === 💬Это пост из ленты, которую чи…
  6. Oct 2, 2026VOYAH ФРИ / FREE СПОРТ+ Гибридный кроссовер в модном цвете сезона - бургунди! Усовершенств…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →