小米开源 CocktailASR-1 目标说话人语音识别模型
小米开源工业级目标说话人语音识别大模型 CocktailASR-1,面向多人同时讲话的“鸡尾酒会”场景。传统 ASR 模型在嘈杂环境中难以分离人声,该模型改变任务输入方式:先指定要听谁说话,再只输出目标说话人的内容,而非单纯做降噪。
模型面向语音识别、智能会议、语音助手等场景,适合需要在多人对话中锁定单一说话人的开发者与产品团队。项目已开源,可进一步查看模型细节与使用方式。
#GitHub #开源 #小米 #CocktailASR #语音识别 #ASR #大模型
@GitHubTrendingHub
Post #1128
25