اکوسیستم صوتی Qwen3 با انتشار مدلهای ASR و TTS، عملاً پازل ارتباط صوتی انسان و ماشین رو در لایه متنباز (Open-source) کامل کرد. این حرکت فراتر از انتشار چند وزن مدل ساده است؛ ما با یک پشته (Stack) کامل پردازش صوت طرف هستیم که برای استفاده در سیستمهای Real-time و Agentic بهینه شده. برخلاف رویکردهای قدیمی که ASR و TTS رو جدا میدیدن، Qwen3 روی یکپارچگی و کاهش تأخیر (Latency) تمرکز کرده تا بشه تجربههایی شبیه به GPT-4o رو به صورت محلی پیاده کرد.
مدل Qwen3-ASR با ظرفیت ۱.۷ میلیاردی، یک راهکار همهکاره برای شناسایی زبان (LID) و تبدیل گفتار به متن در ۵۲ زبان و گویش مختلفه. معماری این مدل طوری طراحی شده که همزمان از استنتاج استریمینگ (Streaming) و آفلاین پشتیبانی میکنه. چیزی که برای من به عنوان مهندس جذابه، انتشار Qwen3-ForcedAligner است. این ابزار با دقت بسیار بالا، زمانبندی (Timestamp) کلمات رو تا ۵ دقیقه صوت مداوم استخراج میکنه. برای پروژههایی که نیاز به زیرنویس دقیق یا همگامسازی لب (Lip-sync) دارن، این ابزار یک جایگزین جدی و سریع برای مدلهای سنگینتر محسوب میشه.
در بخش تولید صدا، Qwen3-TTS با قابلیت شبیهسازی ۳ ثانیهای (3-second Voice Cloning) و کنترل از طریق دستورات متنی، استاندارد جدیدی رو تعریف کرده. نکته کلیدی در مهندسی این مدل، استفاده از معماری Dual-track LM است. استفاده از دو توکنایزر مختلف (۲۵ هرتز برای یکپارچگی معنایی و ۱۲ هرتز برای کاهش نرخ بیت) باعث شده که اولین بسته صوتی (First-packet) در کمتر از ۹۷ میلیثانیه تولید بشه. این یعنی تأخیر در سیستمهای پاسخگویی صوتی عملاً به صفر نزدیک شده. به نظر من، این سطح از بهینهسازی در توکنایزرها، تفاوت اصلی بین یک پروژه آزمایشگاهی و یک محصول آماده برای بازار (Market-ready) رو رقم میزنه.
ارائه این مدلها تحت لایسنس Apache 2.0 و فراهم کردن تولکیتهای استنتاجی مبتنی بر vLLM نشون میده که هدف، دموکراتیزه کردن تکنولوژی Voice-to-Voice بوده. شما الان میتونید با ترکیب Qwen3-ASR برای شنیدن و Qwen3-TTS برای حرف زدن، یک دستیار صوتی کامل بسازید که هم هویت صوتی کاربر رو در ۳ ثانیه کپی میکنه و هم با تأخیر زیر ۱۰۰ میلیثانیه پاسخ میده.
به نظر من، ارزش واقعی این سری در مدلهای کوچیک 0.6B نهفته است. این حجم کم پارامتر یعنی میتونید کل سیستم پردازش صوت رو روی لبه (Edge) یا کارتهای گرافیک ارزانقیمت اجرا کنید، بدون اینکه نیاز به کلاسترهای سنگین داشته باشید. ترکیب Forced Aligner با مدلهای TTS، یک خط تولید محتوای صوتی خودکار رو میسازه که قبلاً پیادهسازیش ماهها زمان میبرد.
📃 مقاله فنی Qwen3-ASR در arXiv:
https://arxiv.org/abs/2601.21337
📃 مخزن مدل ASR در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen3-ASR-1.7B
📃 مقاله فنی Qwen3-TTS در arXiv:
https://arxiv.org/abs/2601.15621
📃 مخزن کد TTS در گیتهاب:
https://github.com/QwenLM/Qwen3-TTS
🛠 Join @LLMEngineers Community
Post #305
977
- ❤ 3
- 👍 2