Новые модели Flash TTS от Google создают ИИ-голоса с нуля по описанию
Google выпустила две модели для синтеза речи — Gemini 3.8 Flash TTS и Flash-Lite TTS. Они поддерживают более 100 языков, умеют вести диалоги двумя голосами, воспроизводить смех, вздохи и другие неречевые звуки, а также учитывать указания для каждой реплики. Flash TTS позволяет создавать голос с нуля по текстовому описанию и клонировать его по 30-секундному аудиосэмплу. Модель рассчитана на подкасты, аудиокниги и игровых персонажей, а Flash-Lite TTS — на недорогую генерацию речи в больших объёмах для дубляжа, аудиоконтента и голосовых агентов. Обе модели постепенно становятся доступны через Gemini API и Google AI Studio, а доступ через Gemini Enterprise API появится позже.
👉 Читать полностью
Post #7523
2