兄弟们,眼下顶级的 AI 配音 / 声音克隆模型,这 5 个建议先存下来。
1️⃣ MiniMax Speech / Audio
中文是真能打,音色克隆、长文本 TTS 都撑得住,做小说、有声书、短视频口播很合适。
🔗 https://www.minimax.io/audio
2️⃣ Qwen3-TTS
阿里通义的开源方案,多语言、声音克隆都支持,关键是能自己部署。
🔗 https://github.com/QwenLM/Qwen3-TTS
3️⃣ ElevenLabs
目前 AI 配音第一梯队,自然度、情绪、语气都很顶,做剧情旁白和有声书尤其舒服。
🔗 https://elevenlabs.io/
4️⃣ Fish Audio / Fish Speech
开源声音克隆里的热门选手,多语言、情感表达、流式生成都不错,本地部署党重点看。
🔗 https://github.com/fishaudio/fish-speech
5️⃣ Microsoft VibeVoice
微软开源的长音频模型,主打超长文本加多人对,很适合播客、访谈这类场景。
🔗 https://github.com/microsoft/VibeVoice
中文优先 MiniMax / Qwen,追求真人感看 ElevenLabs,想白嫖本地部署就重点研究 Fish Speech / VibeVoice。
如今 AI 声音已经越来越难辨真假了,克隆真人声音记得先拿授权。
AI探索 | Hermes/OpenClaw|优质资源|优质信息
Post #25498
275
- 👍 2
- ❤ 1