بهترین مدل برای تشخیص گفتار به صورت متن باز منتشر شد
متخصصان شرکت NVIDIA مدل Nemotron 3 Diarization را ارائه کردند.
این مدل، حتی در فایلهای صوتی که افراد با یکدیگر بحث میکنند، نیز قادر به تشخیص صداها است و میتواند مشخص کند که چه کسی و چه زمانی صحبت میکند.
این مدل برای تشخیص گفتار، گفتگوهایی را با حداکثر 8 شرکتکننده پشتیبانی میکند. این بهترین عملکرد در مقایسه با سایر مدلهای مشابه است: نرخ خطا 14 درصد است که 24 درصد کمتر از نزدیکترین رقیب است.
این مدل فقط از 100 میلیون پارامتر تشکیل شده و به قدرت پردازشی زیادی نیاز ندارد.
https://huggingface.co/spaces/nvidia/nemotron-diarization
Post #14759
3.48K
- 👍 13
- 👎 1