Google научила Gemini создавать голоса с нуля
Google выпустила Gemini 3.8 Flash TTS и более дешевую Flash-Lite TTS. Теперь голос можно не выбирать из готового списка, а описать обычным текстом и собрать под конкретного персонажа или задачу.
Gemini 3.8 Flash TTS позволяет задать роль, акцент, тембр и манеру речи более чем для 100 языков и диалектов. Также доступна библиотека из 2000+ готовых голосов.
Можно скопировать голос по 30-секундному образцу, если есть права на его использование. Для этого Google требует запись согласия владельца голоса. Сгенерированное аудио получает водяной знак SynthID.
Отдельно прокачали управление озвучкой. Для каждой реплики можно задавать темп, эмоцию, акцент и актерскую подачу, добавлять смех, вздохи и короткие реакции. Модель умеет сразу озвучивать диалоги двух персонажей и сохранять их голоса на длинных записях.
Flash TTS предназначена для более сложной режиссуры и создания персонажей. Flash-Lite оптимизирована под массовую озвучку, дубляж и голосовых агентов, где важнее стоимость и масштаб.
Обе модели уже появляются в Gemini API и Google AI Studio. Flash TTS также идет в Gemini Notebook, а Flash-Lite в Google Vids.
dailyprompts.ru
===
💬Это пост из ленты, которую читает Саша - автор канала Мальцев: Карьера. Маркетинг. AI. @maltsevprosto
Другие каналы по темам:
🤖 AI @maltsevdaily
🧑🎓 Карьеры @maltsevdailyc
🦹 Маркетинга @maltsevdailym
Post #115121
3