Google 发布 Gemini 3.8 双款语音模型:可用文字设计音色并逐句导演
Google 的 Gemini API 更新日志将 Gemini 3.8 Flash TTS、Flash-Lite TTS 和新 Voices 接口列为 9 月 22 日正式可用,9 月 23 日又发布产品说明。Flash 面向角色演绎、地区口音和长篇多轮配音;Flash-Lite 侧重低延迟与高吞吐,并被列为 3.1 Flash TTS Preview 的替代型号。两款都接收文字、生成音频,与 3.8 Live 的实时音频对话不同。
开发者可用自然语言创建带持久 ID 的人物音色,或在提交参考音频及声主同意录音后复制声音。新接口把逐句风格、说话人写入结构化 speech_metadata,台词正文按字念读,内联标签则指定笑声和停顿的位置;这也将要念出的字词与演绎指令明确分开。单次请求可编排两名预设音色说话人。Flash 支持 130 种语言,Lite 支持 101 种。要让两个自定义音色对话,目前仍须分别合成再拼接。默认单次输出改为带文件头的 WAV 音频,旧版使用原始 PCM 的程序迁移时需调整。
独立测评机构 Artificial Analysis 在发布当日的英文发音稳健性结果中,给 Flash 89.5%、上一代 3.1 Flash TTS 88.2%、Flash-Lite 87.4%。发音测试让模型以单一固定美式英语音色朗读同一批难读英文句子,由盲审者判断标记片段是否正确,分数是有效判断中的正确比例。
两款模型已通过 Gemini API 和 Google AI Studio 推出,Gemini Enterprise API 尚待开放。持久音色每项目最多保存 200 个,保留 1 年。标准付费价至 2026 年底均为每百万文字输入 token 0.50 美元,音频输出 Flash 9 美元、Lite 6 美元;2027 年 1 月起对应价格翻倍。
Google 更新日志:https://ai.google.dev/gemini-api/docs/changelog
Google 产品说明:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
AA 发音原帖:https://x.com/artificialanlys/status/2102812473816723826
AA 测试方法:https://artificialanalysis.ai/methodology/text-to-speech/pronunciation-robustness-overview
Post #7724
826