TGViewer
Innovation & Research Innovation & Research @abulaphia · 5.15K subscribers
Post #6632 406
Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS с управлением голосом

Google представила две новые модели синтеза речи в семействе Gemini — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые компания называет самыми выразительными среди своих аудиомоделей. Модели доступны разработчикам в Gemini API и Google AI Studio, корпоративным клиентам через Gemini Enterprise, а широкой аудитории — в Gemini Notebook и Google Vids. Старшая модель ориентирована на глубокую творческую режиссуру и дизайн персонажей, младшая — на массовое дублирование и голосовых агентов с оптимизацией по стоимости.

Ключевая возможность — генеративное проектирование голоса: пользователь описывает роль, акцент и характеристики персонажа обычным текстом и получает озвучание более чем на 100 языках и диалектах, включая мексиканский испанский, квебекский французский и шотландский английский. Доступна библиотека из более чем 2000 готовых голосов, а репликация собственного голоса выполняется по 30-секундному образцу при обязательной проверке согласия владельца. Все аудиофрагменты маркируются невидимой меткой SynthID и снабжаются учётными данными C2PA. Режиссура ведётся построчно: задаются темп, эмоции, смена диалекта, а также невербальные реакции — смех, вздох, междометия; поддерживаются двухголосые сцены и длинные записи без дрейфа тембра.

По оценкам независимых платформ, Gemini 3.8 Flash TTS занял первое место в Voice Design Benchmark от Hume AI с результатом 71.4 и лидирует в моделировании акцентов (60.8); модели заняли первое и второе места в Overall Quality Index. В слепых сравнениях предпочтений на Voice Arena они возглавили позиции в ряде языков, включая японский, бразильский португальский, вьетнамский, современный стандартный арабский, мексиканский испанский и хинди.

Google развивает партнёрскую экосистему: интеграцию выполняют Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, а платформы Agora, LiveKit, Pipecat и Vercel упрощают развёртывание голосовых интерфейсов.

#news #AI #речевойAI #СинтезРечи

https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
Google Gemini 3.8 text-to-speech says hello Gemini 3.8 Flash-Lite TTS and Gemini 3.8 Flash TTS are our most expressive audio models yet.
  • ❤ 1
  • 🔥 1
More from @abulaphia
  1. Sep 30, 2026Tesla запустила перевозки на беспилотных такси Cybercab без руля и педалей Компания Tesla…
  2. Sep 29, 2026Розетка на орбите Спутник, который покупает электричество у другого спутника. Именно такую…
  3. Sep 29, 2026Google, OpenAI и Anthropic намерены создать отраслевой орган по стандартам безопасности AI…
  4. Sep 28, 2026Главы OpenAI и Anthropic призвали ООН координировать усилия по AI через день после речи Тр…
  5. Sep 27, 2026Китай строит корабль-матку для гигантских подводных дронов: спутниковые снимки указывают н…
  6. Sep 26, 2026ВВС США ищут дешёвую и массовую замену беспилотнику MQ-9 Reaper для действий в зонах насыщ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →