谷歌周三推出两款新的文本转语音模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,其中前者更侧重声音表现力和复杂创意场景,后者针对大规模、低成本的语音生成优化,应用场景包括内容配音、音频制作以及实时语音代理。
据谷歌开发者文档,两款模型分别支持130种和101种语言,并可根据文字指令调整声音、语速、情绪和对话方式;Flash TTS支持通过自然语言提示词从零设计声音,也支持根据约30秒的音频样本复制声音,进行声音复制时需获得声音所有者的同意并通过相应的同意验证机制,生成音频会嵌入不可感知的SynthID水印。#新模型
Post #34342
352