اگه دنبال یه جایگزین Local برای ElevenLabs هستید، VoiceStudio رو ببینید یه استودیوی کامل AI برای صداست که میتونه روی سختافزار خودتون اجرا بشه؛ بدون اکانت، API Key، اشتراک یا پرداخت بهازای مصرف در workflow لوکال.
قابلیت Voice Cloning با یه نمونه صدای کوتاه، صدای گوینده رو Clone کنید. حتی 3 ثانیه نمونه هم قابل استفادهست، ولی 5 تا 15 ثانیه معمولاً نتیجه بهتری میده.
با قابلیت Text-to-Speec متن رو با موتورهای مختلف TTS به صدای طبیعی تبدیل کنید.
با Voice Design حتی لازم نیست نمونه صدا داشته باشید؛ میتونید سن، لهجه، pitch، سبک و نوع بیان صدا رو توصیف کنید و صدا بسازید.
با Video Dubbing ویدیو رو Transcribe میکنه، ترجمه میکنه، speakerها رو تشخیص میده، دوباره با صدای مناسب تولید میکنه و خروجی ویدیو میده.
با Voice Isolation صدای گوینده رو از موسیقی و background جدا میکنه.
با Speaker Diarization تشخیص میده هر بخش از فایل صوتی رو کدوم speaker گفته:
github.com/debpalash/VoiceStudio
@Linuxor
Post #5134
9.01K