انویدیا مدل جدید Nemotron-3 Diarization را منتشر کرد؛ مدلی با ۱۰۰ میلیون پارامتر که در تشخیص «چه کسی، چه زمانی صحبت کرده» تخصص دارد. این مدل حتی زمانی که صداها با هم تداخل دارند، میتواند تا ۸ گوینده را بهصورت همزمان و بلادرنگ ردیابی کند. برای مطالعه جزئیات بیشتر، نسخه کامل مطلب در سایت را ببینید.
مهمترین ویژگیهای این مدل عبارتند از:
- دقت بالا: ثبت نرخ خطای ۱۴.۷۲٪ در بنچمارک Diarization-Bench.
- سرعت بینظیر: پشتیبانی از پردازش جریان صوتی با زمان پاسخ بسیار پایین (تا ۰.۳۲ ثانیه).
- مجوز آزاد: عرضه تحت لایسنس OpenMDW-1.1 با امکان استفاده تجاری.
- بهینهسازی: اجرای بهینه روی پردازندههای گرافیکی NVIDIA در بستر NeMo.
شما میتوانید برای بررسی عملکرد مدل، از دموی آنلاین آن استفاده کنید یا جزئیات فنی بیشتر را در وبلاگ رسمی NVIDIA مطالعه کنید.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#Nemotron_3_Diarization #Diarization_Bench
