Google выпустила Gemini 3.8 Flash TTS — модель, которая создаёт голоса с нуля по текстовому описанию
Продолжение поста
Модели умеют генерировать многочасовой аудиоконтент, не теряя качество голоса, воспроизводить диалоги двух персонажей из одного сценария, вставлять смех, вздохи и другие звуки через теги в тексте. Все файлы получают встроенный водяной знак SynthID, по которому можно определить, что аудио создано ИИ.
Цена для разработчиков: Flash TTS — $0,5 за входной миллион токенов и $9 за выходной; Flash-Lite TTS — $0,5 и $6. Это актуально до 31 декабря 2026 года, с 1 января 2027-го тарифы вырастут вдвое.
Flash TTS ориентирован на сложные проекты: озвучку персонажей в играх, аудиокниги, подкасты — там, где важна детальная режиссура голоса. Flash-Lite TTS заточен под массовое производство: большие объёмы дубляжа, голосовые агенты, потоковая генерация контента.
На бенчмарке голосового дизайна от Hume AI модель Flash TTS заняла первое место по общему счёту (71,4 балла) и лидирует в передаче акцентов (60,8 балла). Flash-Lite TTS — второй в общем рейтинге той же платформы. В пользовательском тесте Voice Arena обе модели вошли в топ по японскому, португальскому и хинди.
Доступ открылся 23 сентября 2026 года. Flash TTS доступен разработчикам через Gemini API и Google AI Studio, обычным пользователям — в Gemini Notebook. Flash-Lite TTS для рядовых пользователей появится в Google Vids. Корпоративные клиенты получат оба варианта через Gemini Enterprise — сроки не уточнены.
Платформы Agora, LiveKit, Pipecat и Vercel уже работают с моделями через Gemini API. Figma и HeyGen встраивают их в свои сервисы. Есть бесплатный уровень; асинхронная обработка через Batch и Flex обходится вдвое дешевле стандартного тарифа.
Источник: ITmedia AI+ (🇯🇵)
#Google #GeminiFlashTTS #синтезречи #ИИ
Post #2748
6