مدل Pocket-TTS از آزمایشگاه Kyutai یه حرکت جالب توی دنیای سنتز صداست که بر خلاف اکثر سیستمهای فعلی، به جای استفاده از توکنهای گسسته (Discrete Tokens)، بر پایه مفهوم "مدلسازی پیوسته صوت" (Continuous Audio Modeling) ساخته شده. مقاله فنی این تیم که نسخه سومش همین ژانویه ۲۰۲۶ منتشر شد، نشون میده که چطور میشه با استفاده از جریانهای پیوسته صوتی، به خروجیهایی رسید که هم طبیعیتر هستن و هم آرتیفکتهای کمتری دارن.
تکنولوژی CALM یا همان Continuous Audio Language Models، ستون فقرات این پروژهست. ایده اصلی اینه که صوت رو به صورت یک جریان مداوم و بدون تکهتکه کردن (Quantization) به کدهای دیجیتال، مدلسازی کنن. این رویکرد باعث میشه لحن صدا (Prosody) و جزئیات ظریف انسانی خیلی بهتر حفظ بشه. نکته مهندسی ماجرا اینجاست که Kyutai موفق شده این تئوری سنگین رو در قالب Pocket-TTS به یه ابزار کاربردی و سبک تبدیل کنه که برای محدودیتهای سختافزاری واقعی طراحی شده.
تمرکز Pocket-TTS روی "قابلیت استفاده" (Deployability) است. در حالی که مدلهای بزرگ TTS برای خروجیهای استودیویی عالی هستن، اما برای استفاده در دستگاههای موبایل یا ایجنتهایی که نیاز به پاسخگویی در لحظه دارن، سنگین و کند محسوب میشن. این پروژه با ارائه کد و کانفیگهای بهینه در گیتهاب، هدفش اینه که سنتز صدای باکیفیت رو به محیطهای با منابع محدود بیاره. به نظر من، این که یه آزمایشگاه تحقیقاتی مثل Kyutai به جای انتشار یه مدل غولآسا، روی "Pocket-sized" کردن تکنولوژی تمرکز کرده، نشوندهنده درک درستشون از نیاز بازار در سال ۲۰۲۶ هست.
واقعیت اینه که مدلسازی پیوسته صوت پتانسیل این رو داره که استاندارد طلایی TTS بشه، چون مشکل همیشگی "روباتیک بودن" صدا در سیستمهای مبتنی بر Codec رو حل میکنه. اگه دارید روی اپلیکیشنهایی کار میکنید که نیاز به تعامل صوتی سریع و در عین حال باکیفیت دارن، Pocket-TTS یه گزینه سینیور و مهندسیشدهست که نباید ازش بگذرید.
📃 مقاله فنی Continuous Audio Language Models در arXiv:
https://arxiv.org/abs/2509.06926
📃 مخزن کد Pocket-TTS در گیتهاب:
https://github.com/kyutai/pocket-tts
🛠 Join @LLMEngineers Community
Post #306
978