【通义实验室】发布两款支持FreeStyle自然语言控制的语音模型
阿里通义实验室语音团队正式发布两款语音生成大模型:Fun-CosyVoice 3.5 及 Fun-AudioGen-VD。这两款模型均支持全新的 FreeStyle 自然语言控制范式,用户无需像过去那样手动挑选标签或调节繁琐参数,通过简单的一句话描述语句即可控制模型生成所需的声音与表达效果。
从具体功能来看,Fun-CosyVoice 3.5 侧重于声音复刻与细粒度的情感表达,仅需数秒提示音频即可完成高一致性的声音克隆,本次升级新增了泰语、印尼语等支持并降低了首字延迟。Fun-AudioGen-VD 则专注于声音角色设计与听觉场景构建,可基于文本描述精细刻画面部特征(如年龄、口音、沙哑等音色)和复杂情绪状态,更能叠加如城市环境背景底噪、特殊空间混响及收音设备质感,直接生成完整的沉浸式音频空间。
#通义实验室 #语音生成 #AI大模型 #声音克隆 通义实验室
Post #4849
1.47K