مخزن OmniVoice: TTS: کلون صدا با ۶۰۰+ زبان
این پروژه یک مدل TTS خیلی قویایه که بدون fine-tune، روی بیش از ۶۰۰ زبان حرف میزنه. معماریش شبیه diffusion language model ساخته شده و هم کیفیت صدا بالاست، هم سرعتش. صدا رو از یه reference کوتاه clone میکنه، یا بدون reference با صفتهایی مثل gender، age، pitch، لهجه و حتی whisper صدا میسازه. تگهایی مثل [laughter] هم میفهمه و تلفظ رو با pinyin یا phoneme میشه اصلاح کرد.
توی ورکفلو ویدیو و پادکست اینطوری به درد میخوره: یه ویس کوتاه از گوینده میدی، متن فارسی یا انگلیسی یا هر زبان دیگهای رو میذاری، همون صدا رو خروجی میگیری.
اگه reference نداری، با دستورهایی مثل male, British accent صدا design میکنی. نصبش با pip یا uv راه میافته، API پایتون و CLI داره، حتی دموی وب و Space روی Hugging Face هم داره.
لینک GitHub:
https://github.com/k2-fsa/OmniVoice
@DevTwitter | <Diego Jr/>
Post #13209
6.8K

- ❤ 21
- 👍 6
- 🔥 2