Google выкатил своих реалтаймовых аватаров.
Да, это прямой конкурент Runway Characters и Pika Stream.
Но я считаю, что Google просто всех пожрёт и уничтожит на этом поле. И здесь не важны цены, здесь не важны фичи, здесь важна юзер-база и вся система, в которую встроены аватары, точнее встроены клиенты Google.
Не случайно раскатка идёт только на Enterprise. Ну, просто потому что это решение, ориентированное прежде всего на компании, которые делают своих говорящих чат-ботов, которые зачем-то прикручивают говорящие головы в колл-центры, которые, опять же, зачем-то делают службу поддержки с говорящими аватарами и всю эту зловещую долину.
Но самое главное преимущество Google в том, что они не продают реалтаймовый рендеринг или реалтаймовый ответ. Они продают всё в одном флаконе: и LLM, и видео, и звук, и мозги. В то время как Runway концентрируются в основном на рендер-слое.
Итак:
Модель реально слышит голос, может одновременно "видеть" поток с камеры или screen share, понимает, что происходит, вызывает tools и API, отвечает голосом и тут же генерирует лицо, мимику и lip-sync. Если перебить - разговор перестраивается. Поддерживается переключение между 97(!) языками прямо во время диалога.
И все это в Реальном времени!
Можно взять готового персонажа из генерации Google или загрузить reference photo + образец голоса и получить своего. Правда, custom avatars пока дают только через enterprise allowlist. И там огого рестрикшены. БредовПиттов не присунешь.
Посмотрите видосы. В принципе мы все это видели у Рунвей и Виду, просто у Гугла мышц больше и неограниченная дурь на серварах.
И теперь самое интересное - сколько стоит эти твари.
Avatar video output:
$1 за 1 млн video tokens.
А Live Avatar расходует 6 192 video tokens в секунду.
Считаем:
6 192 x 60 / 1 000 000 = $0.3715 за минуту.
То есть примерно $0.37 за минуту, пока аватар говорит.
Когда он заткнулся и слушает кожаного - за avatar video Google денег не берёт.
К видео добавляется собственная речь Gemini. Audio output стоит $12 за 1 млн tokens. По опубликованному Google коэффициенту 25 audio tokens/sec это ещё примерно $0.018 за минуту речи.
Итого грубо:
Gemini Live Avatar -> около $0.39 за минуту активной речи.
Плюс мелочь за входящий звук, видео, текст и reasoning. И есть ещё одна засада: Gemini Live повторно обрабатывает накопленный session context на каждом диалоге, поэтому длинный разговор постепенно дорожает.
Теперь сравним с конкурентами.
Runway Characters -> $0.20 за минуту.
То есть сам realtime-видеоперсонаж Runway примерно в 1.86 раза дешевле видеослоя Gemini: $0.20 против $0.3715.
Но.
Runway прежде всего продаёт визуальный слой. К нему можно подключить своего агента, свой LLM, STT и TTS. Runway официально предусматривает такую архитектуру и интеграции с LiveKit/ElevenLabs.
На итоге может быть недешево.
Google продаёт всю тварь целиком и сразу: мозг, слух, голос, зрение, tools и лицо являются частями одного realtime-контура.
Но.
Есть еще Vidu S2 ~$0.315 - у него существует полностью комплектный Real-time Edition: ASR + LLM + TTS + RTC + avatar. Документация прямо перечисляет эти компоненты как предоставляемые Vidu. Тоже полный организьм.
Также Vidu S2 пытается генерировать живого персонажа целиком, а не только морду: 720p, до 42 FPS, движения тела, танец, взаимодействие с предметами, смена одежды и фона непосредственно во время разговора.
Но я вернусь к началу поста.
Гугль всех пожрет. Где Рунвей с Виду - и где Гугль?!
Юзер база плюс экосистема. Стартапам никогда не добраться до цифр Гугла.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/
https://cloud.google.com/blog/products/ai-machine-learning/gemini-3-8-live-with-live-avatar-is-now-generally-available/
https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/guides/gemi
Post #16773
2.99K