TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #306 978
مدل Pocket-TTS از آزمایشگاه Kyutai یه حرکت جالب توی دنیای سنتز صداست که بر خلاف اکثر سیستم‌های فعلی، به جای استفاده از توکن‌های گسسته (Discrete Tokens)، بر پایه مفهوم "مدل‌سازی پیوسته صوت" (Continuous Audio Modeling) ساخته شده. مقاله فنی این تیم که نسخه سومش همین ژانویه ۲۰۲۶ منتشر شد، نشون میده که چطور میشه با استفاده از جریان‌های پیوسته صوتی، به خروجی‌هایی رسید که هم طبیعی‌تر هستن و هم آرتیفکت‌های کمتری دارن.

تکنولوژی CALM یا همان Continuous Audio Language Models، ستون فقرات این پروژه‌ست. ایده اصلی اینه که صوت رو به صورت یک جریان مداوم و بدون تکه‌تکه کردن (Quantization) به کدهای دیجیتال، مدل‌سازی کنن. این رویکرد باعث میشه لحن صدا (Prosody) و جزئیات ظریف انسانی خیلی بهتر حفظ بشه. نکته مهندسی ماجرا اینجاست که Kyutai موفق شده این تئوری سنگین رو در قالب Pocket-TTS به یه ابزار کاربردی و سبک تبدیل کنه که برای محدودیت‌های سخت‌افزاری واقعی طراحی شده.

تمرکز Pocket-TTS روی "قابلیت استفاده" (Deployability) است. در حالی که مدل‌های بزرگ TTS برای خروجی‌های استودیویی عالی هستن، اما برای استفاده در دستگاه‌های موبایل یا ایجنت‌هایی که نیاز به پاسخگویی در لحظه دارن، سنگین و کند محسوب میشن. این پروژه با ارائه کد و کانفیگ‌های بهینه در گیت‌هاب، هدفش اینه که سنتز صدای باکیفیت رو به محیط‌های با منابع محدود بیاره. به نظر من، این که یه آزمایشگاه تحقیقاتی مثل Kyutai به جای انتشار یه مدل غول‌آسا، روی "Pocket-sized" کردن تکنولوژی تمرکز کرده، نشون‌دهنده درک درستشون از نیاز بازار در سال ۲۰۲۶ هست.

واقعیت اینه که مدل‌سازی پیوسته صوت پتانسیل این رو داره که استاندارد طلایی TTS بشه، چون مشکل همیشگی "روباتیک بودن" صدا در سیستم‌های مبتنی بر Codec رو حل می‌کنه. اگه دارید روی اپلیکیشن‌هایی کار می‌کنید که نیاز به تعامل صوتی سریع و در عین حال باکیفیت دارن، Pocket-TTS یه گزینه سینیور و مهندسی‌شده‌ست که نباید ازش بگذرید.

📃 مقاله فنی Continuous Audio Language Models در arXiv:

https://arxiv.org/abs/2509.06926

📃 مخزن کد Pocket-TTS در گیت‌هاب:

https://github.com/kyutai/pocket-tts

🛠 Join @LLMEngineers Community
arXiv.org Continuous Audio Language Models Audio Language Models (ALM) have emerged as the dominant paradigm for speech and music generation by representing audio as sequences of discrete tokens. Yet, unlike text tokens, which are...
  • ❤ 5
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →