مایکروسافت مدل جدید MAI-Transcribe-2-Streaming را برای تبدیل لحظهای گفتار به متن منتشر کرد. این مدل اکنون با نرخ خطای ۲.۵ درصد در جایگاه نخست بنچمارک AA-WER قرار گرفته است.
برخی از ویژگیهای عملکردی این مدل عبارتند از:
* دقت و سرعت: دستیابی به نرخ خطای ۲.۵ درصد در زمان ۰.۱۳ ثانیه پس از پایان صحبت که نسبت به مدلهایی مانند Grok Voice Transcribe 2.0 با نرخ ۲.۷ درصد و تأخیر ۰.۴۹ ثانیه، بهبود یافته است.
* هزینه: قیمت سرویس استریمینگ این مدل ۰.۵۴ دلار به ازای هر ساعت صدا (معادل ۹ دلار برای هر ۱۰۰۰ دقیقه) تعیین شده است.
* نسخه آفلاین: هزینه تبدیل گفتار به متن در حالت غیراستریمینگ (non-streaming) معادل ۰.۱۰ دلار برای هر ساعت است.
این مدل در بخش First Partial Transcript نیز دقت مشابه ۲.۵ درصد را در زمان ۰.۱۲ ثانیه ثبت کرده است. جزئیات بیشتر و مقایسه با سایر مدلها در وبسایت Artificial Analysis در دسترس است.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#MAI_Transcribe_2_Streaming #WER