نسخهی جدید Pocket TTS Farsi v2 منتشر شد!
تبدیل متن فارسی به گفتار که روی CPU اجرا میشه؛ بدون GPU و بدون API. فقط حدود ۱۰۰ مگابایت، چند برابر سریعتر از زمان واقعی، و با امکان کلون کردن هر صدایی فقط با ۵ ثانیه فایل صوتی.
این نسخه با ۹۷۳ ساعت داده و ۲,۹۷۸ گوینده آموزش داده شده و در تمام معیارها از v1 بهتره. حتی در تست شنیداری blind هم عملکرد بهتری داشت.
توی ویدیوی پایین توضیح دادم یک سری چیزها را. با صدا ببینید.👇
اما جالبترین چیزی که در این مسیر یاد گرفتم (۱۰۰۰ دلار بیشتر هزینه آموزش😅 ) این بود که benchmark من در واقع داشت مدلی رو ارزیابی میکرد که تقریباً درعمل اینجوری نبود. به خاطر ۴ تا باگ مهم که توی کدی پنهان شده بود و evaluation من حتی یک بار هم اجراشون نکرده بود. از جمله یک خط کد که بیسروصدا اولین کلمهی هر جمله رو حذف میکرد!
توی پست جدید، کل این مسیر رو نوشتم؛ از مشکلات benchmark گرفته تا چیزهایی که یک benchmark اساساً نمیتونه در زبانی مثل فارسی بشنوه، زبانی که Vowels / مصوتها رو بهصورت کامل در نوشتار نمایش نمیده.
لینک بلاگ: https://mlnotes.substack.com/p/my-benchmark-was-testing-a-model
🤗 مدل: http://huggingface.co/mehdi-hf/pocket-tts-farsi-v2
💻 کد: http://github.com/mallahyari/pocket-tts
Post #495
715