🪟🎙️ مایکروسافت مدلهای صوتی جدیدش را معرفی کرد!
مایکروسافت از MAI-Transcribe-2-Streaming رونمایی کرده؛ مدلی که برای تبدیل لحظهای صدا به متن طراحی شده و از ۶۰ زبان پشتیبانی میکند. این شرکت میگوید مدل جدید از نظر دقت، در رتبه نخست ارزیابی Artificial Analysis قرار گرفته است. 🧠
اما مدل صوتی دیگر مایکروسافت هم جالب است:
🔹 MAI-Voice-2.1
برای تبدیل متن به گفتار با پشتیبانی از ۲۳ زبان
🔹 حفظ هویت و ویژگیهای صدای گوینده هنگام تغییر زبان و لهجه
🔹 نسخه Flash با تأخیر حدود ۱۵۰ میلیثانیه
🔹 ۵۵٪ سرعت استنتاج بیشتر و ۶۰٪ هزینه کمتر نسبت به مدلهای مشابه
🎧 بهنظر میرسد مایکروسافت میخواهد حضور پررنگتری در رقابت مدلهای صوتی بلادرنگ داشته باشد؛ از رونویسی مکالمات گرفته تا ساخت صداهای چندزبانه و طبیعی.
Post #3712
149
