TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #305 977
اکوسیستم صوتی Qwen3 با انتشار مدل‌های ASR و TTS، عملاً پازل ارتباط صوتی انسان و ماشین رو در لایه متن‌باز (Open-source) کامل کرد. این حرکت فراتر از انتشار چند وزن مدل ساده است؛ ما با یک پشته (Stack) کامل پردازش صوت طرف هستیم که برای استفاده در سیستم‌های Real-time و Agentic بهینه شده. برخلاف رویکردهای قدیمی که ASR و TTS رو جدا می‌دیدن، Qwen3 روی یکپارچگی و کاهش تأخیر (Latency) تمرکز کرده تا بشه تجربه‌هایی شبیه به GPT-4o رو به صورت محلی پیاده کرد.

مدل Qwen3-ASR با ظرفیت ۱.۷ میلیاردی، یک راهکار همه‌کاره برای شناسایی زبان (LID) و تبدیل گفتار به متن در ۵۲ زبان و گویش مختلفه. معماری این مدل طوری طراحی شده که همزمان از استنتاج استریمینگ (Streaming) و آفلاین پشتیبانی می‌کنه. چیزی که برای من به عنوان مهندس جذابه، انتشار Qwen3-ForcedAligner است. این ابزار با دقت بسیار بالا، زمان‌بندی (Timestamp) کلمات رو تا ۵ دقیقه صوت مداوم استخراج می‌کنه. برای پروژه‌هایی که نیاز به زیرنویس دقیق یا همگام‌سازی لب (Lip-sync) دارن، این ابزار یک جایگزین جدی و سریع برای مدل‌های سنگین‌تر محسوب میشه.

در بخش تولید صدا، Qwen3-TTS با قابلیت شبیه‌سازی ۳ ثانیه‌ای (3-second Voice Cloning) و کنترل از طریق دستورات متنی، استاندارد جدیدی رو تعریف کرده. نکته کلیدی در مهندسی این مدل، استفاده از معماری Dual-track LM است. استفاده از دو توکنایزر مختلف (۲۵ هرتز برای یکپارچگی معنایی و ۱۲ هرتز برای کاهش نرخ بیت) باعث شده که اولین بسته صوتی (First-packet) در کمتر از ۹۷ میلی‌ثانیه تولید بشه. این یعنی تأخیر در سیستم‌های پاسخگویی صوتی عملاً به صفر نزدیک شده. به نظر من، این سطح از بهینه‌سازی در توکنایزرها، تفاوت اصلی بین یک پروژه آزمایشگاهی و یک محصول آماده برای بازار (Market-ready) رو رقم میزنه.

ارائه این مدل‌ها تحت لایسنس Apache 2.0 و فراهم کردن تولکیت‌های استنتاجی مبتنی بر vLLM نشون میده که هدف، دموکراتیزه کردن تکنولوژی Voice-to-Voice بوده. شما الان می‌تونید با ترکیب Qwen3-ASR برای شنیدن و Qwen3-TTS برای حرف زدن، یک دستیار صوتی کامل بسازید که هم هویت صوتی کاربر رو در ۳ ثانیه کپی می‌کنه و هم با تأخیر زیر ۱۰۰ میلی‌ثانیه پاسخ میده.

به نظر من، ارزش واقعی این سری در مدل‌های کوچیک 0.6B نهفته است. این حجم کم پارامتر یعنی می‌تونید کل سیستم پردازش صوت رو روی لبه (Edge) یا کارت‌های گرافیک ارزان‌قیمت اجرا کنید، بدون اینکه نیاز به کلاسترهای سنگین داشته باشید. ترکیب Forced Aligner با مدل‌های TTS، یک خط تولید محتوای صوتی خودکار رو می‌سازه که قبلاً پیاده‌سازیش ماه‌ها زمان می‌برد.

📃 مقاله فنی Qwen3-ASR در arXiv:
https://arxiv.org/abs/2601.21337

📃 مخزن مدل ASR در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen3-ASR-1.7B

📃 مقاله فنی Qwen3-TTS در arXiv:
https://arxiv.org/abs/2601.15621

📃 مخزن کد TTS در گیت‌هاب:
https://github.com/QwenLM/Qwen3-TTS

🛠 Join @LLMEngineers Community
  • ❤ 3
  • 👍 2
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →