Tavus показала Griffin - новый real-time AI-аватар, который уже выглядит не как очередная “говорящая фотография”, а как попытка генерировать целиком живого собеседника во время разговора.
Спойлер, про слепые тесты Туринга в конце.
Griffin получает вашу речь и видео, продолжает слушать и смотреть на вас даже в тот момент, когда отвечает сам, а параллельно генерирует голос, лицо, взгляд, мимику, жесты и весь кадр виртуального кожаного. То есть он умеет не только синхронно шевелить губами, но и кивнуть во время вашей фразы, отвести взгляд, отреагировать выражением лица, вставить короткую реплику или остановиться, когда его перебили.
Причём это, внимание, real-time генерация, а не заранее сделанный ролик.
Видеочасть Griffin-Lite работает в 720p при 25 fps. Модель генерирует видео кусками по 320 ms: один latent = 8 кадров. На каждый такой кусок приходится всего 3 diffusion steps, после чего он сразу декодируется и отправляется зрителю на том конце. Средняя задержка от входящего аудио до соответствующей реакции в видео в тестах Tavus составляет 0.43 секунды на NVIDIA H100.
Но здесь важная оговорка: из этого не следует, что весь Griffin “работает с latency 430 ms”. В полном разговорном тесте NVIDIA медианная реакция Griffin была около 1.9-2.2 секунды в зависимости от задачи. 0.43 секунды - именно latency видеогенератора после поступления управляющего аудиосигнала.
По железу Tavus раскрывает только часть картины. Именно тест видеогенератора проводился на H100. В credits компания отдельно благодарит Baseten, Daily и Cerebrium за инфраструктуру research preview, но сколько GPU требуется на одну сессию и на каких именно конфигурациях работает весь Griffin, Tavus пока не сообщает. Поэтому утверждать, что “один Griffin = один H100”, нельзя.
И попробовать всё это тоже, блин, пока нельзя.
Конкуренты.
Google неделю назад выпустила Gemini 3.8 Live with Live Avatar. Писал про это недавно. Это тоже настоящий потоковый аватар: Gemini одновременно получает аудио и изображение с камеры, ведёт native speech-to-speech диалог и генерирует синхронного аватара в 24 fps. Он видит камеру и screen sharing, поддерживает 97 языков и tool calling прямо во время разговора. Live Avatar уже доступен в Gemini Enterprise, хотя создание собственного аватара по фотографии пока требует allowlist.
Runway Characters идёт немного с другой стороны. Из одной картинки можно сделать real-time персонажа с голосом и характером, который разговаривает через WebRTC, может видеть webcam и screen share. В Runway уже можно попробовать это самому: веб-версия ограничивает разговор двумя минутами, API - пятью минутами, цена самого Characters сейчас составляет 2 кредита за 6 секунд, то есть около $0.20 за минуту. Причём Runway позволяет вообще принести свой STT + LLM + TTS, а Characters использовать только как real-time видеослой.
А Vidu S2-Avatar вообще уже продаётся как полноценная streaming-модель. Она принимает изображение персонажа и ведёт real-time голосовой диалог, поддерживает interruption, управление движениями, а во время разговора ей можно дать фотографию предмета, одежды или нового фона - персонаж может взять предмет, переодеться или изменить окружение прямо в потоке. У S2 есть публичный demo и API.
То есть сам факт “живого аватара в реальном времени” уже не мегафича. Google это делает, Runway это делает, Vidu это делает.
Интерес Griffin скорее в другом: Tavus пытается связать понимание разговора и генерацию невербального(!!!) поведения гораздо теснее. Видео здесь должно быть не просто визуализацией уже готового аудио. Разговорная модель отдельно управляет
gesture, gaze, emotion и может менять их уже в следующем 320-ms куске видео.Зато Tavus уже неистово хайпуют: “первая модель, прошедшая video Turing test”.
54 человека посадили на минутный видеозвонок. Им сказали, что сейчас их соединят с другим участником исследования. На самом деле напротив кожаных сидел Griffin-Lite, который в реальном времени генерировал лицо, голос и ответы.
После звонка 26 из 54 человек - 48% - сказали, что разговаривали с настоящим человеком. Для предыдущей версии Tavus результат был 1 из 41.
Вот эти 48% Tavus и называет прохождением video Turing test. Штош.
Строго говоря, никакого общепринятого стандарта “video Turing test” не существует, а эксперимент был крохотным и ещё немного подталкивал кожаных в нужную сторону: им изначально сказали, что они встретятся с другим человеком, а вопрос про ИИ появился только после разговора.
Но результаты всё равно нарядные.
Почти половина кожаных в условно слепом тесте просто не заметила, что напротив них вообще нет кожаного.
И, наверное, именно поэтому Tavus пока не даёт Griffin всем желающим. Представляю, какое количество мошеннических схем можно замутить с таким видосом.
Но вы мысленно готовьтесь жить в новом мире. Где вообще никому и ничему нельзя верить не то что на слово, а и на глаз.
https://www.tavus.io/
https://research.nvidia.com/labs/amri/projects/video-fdb/
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://help.runwayml.com/hc/en-us/articles/49557780326163-Runway-Charactershttps://s.vidu.com/vidu-stream/
@cgevent