در ادامه آموزش مدلهای مختلف برای زبان فارسی، نوبت رسید به آموزش مدل فارسی تبدیل گفتار به متن یا STT.
مدل جدید تشخیص گفتار فارسی، رایگان و متنباز که آموزش دادم.
مدل تبدیل گفتار به متن Nemotron 3.5 انویدیا زبانهای زیادی را پشتیبانی میکند، اما فارسی جزو آنها نبود. آن را روی ۱٬۱۸۱ ساعت گفتار فارسی آموزش دادم و حالا بهصورت رایگان و متنباز منتشرش کردهام.
تا جایی که میدانم، این دقیقترین مدل متنباز تشخیص گفتار فارسی است: خطای کلمه روی FLEURS ۸٫۸٪، در برابر ۱۰٫۶٪ برای «شنوا»، قویترین مدل متنباز فارسی پیش از این. نه تنها این بلکه WER مدل ElevenLabs Scribe روی همین دیتاست ۷.۸% هست.
ویدیوی زیر را با صدا گوش بدید که توش کامل توضیح دادم.
- تبدیل زندهی گفتار به متن: همانطور که حرف میزنید متن نوشته میشود، با تأخیری حدود ۰٫۳ تا ۱ ثانیه
- تبدیل فایلهای صوتی
- در مقایسه با مدل فارسی قبلی انویدیا، خطا روی FLEURS از ۲۴٫۲٪ به ۸٫۸٪ رسید
- روی گفتار محاورهای (یوتیوب، فیلم و سریال) خطا تقریباً نصف شد: ۲۶٪ در برابر ۵۴٪
- روی لپتاپ هم اجرا میشود: حدود ۱۰ برابر سریعتر از زمان واقعی روی مک M1
- با NeMo و Hugging Face Transformers کار میکند
یک اپ ساده هم گذاشتهام که میتوانید با میکروفون خودتان امتحانش کنید.
ریپو را ستاره بدید اگه دوست داشتید.
مدل: https://huggingface.co/mehdi-hf/nemotron-asr-streaming-farsi
آموزش و اجرا: https://github.com/mallahyari/nemotron-asr-streaming-farsi
@DevTwitter | <Mehdi Allahyari/>
Post #13428
1.68K