Google выкатил Gemini 3.8 TTS.
Видимо все силы кинул в голос )
Моделей две:
– Gemini 3.8 Flash TTS: для творческой работы, чтобы задать характер персонажа и сыграть сцену
– Gemini 3.8 Flash-Lite TTS: для больших объёмов, когда важна цена
Что умеют:
– Голос генерируется по текстовому описанию, больше 100 языков и диалектов
– Больше 2000 готовых голосов с региональными вариантами: мексиканский испанский, квебекский французский, шотландский английский
– Клонирование голоса по 30-секундному сэмплу, с проверкой согласия и водяным знаком SynthID
– Режиссура по строкам: в сценарии пишешь ремарки обычным языком, и модель их отыгрывает
– Держат голос стабильным на часах аудио
– Нативный диалог двух спикеров
– Смех, вздохи, «ага», «угу», перебивания: всё, что раньше выдавало робота
– Скоро обещают ремикс голоса: тембр, высота, темп, акцент
По бенчмаркам:
– Hume AI Voice Design: первое место (71.4), по акцентам тоже первое (60.8)
– Hume AI Overall Quality: первое и второе места у Flash и Flash-Lite
– Voice Arena: топ по японскому, бразильскому португальскому, вьетнамскому, арабскому, мексиканскому испанскому и хинди
Доступно уже сегодня
Видос: https://youtu.be/FL6mI_Br-mc
Есть и ложка дёгтя: клонирование голоса не работает в ЕС, Великобритании, Швейцарии, Индии, Иллинойсе и Техасе.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
Post #16753
2.75K
Forwarded from AI Product | Igor Akimov
YouTube Create your own voices with Gemini 3.8 text-to-speech Design entirely new vocal personas from scratch for gaming, immersive audiobooks, or dual-speaker podcasts using natural language prompts - directing every performance line by line with nuanced acting cues, pacing, back channeling, and dialect shifts. Or…- 🔥 11
- 👍 5
- ❤ 3