Qwen-Audio-3.1
Пять моделей, полный аудио-стек: распознавание, генерация, диалог и создание. Сильное снижение цен - #TTS дешевле на 70%, #Realtime на 85%, #ASR до 95%
• ASR - мультиязычное и диалектное распознавание, авточистка текста от мусорных слов
• ASR-Next - мультиспикерная ASR с метками говорящих, таймштами и пониманием эмоций
• TTS - синтез с переносом голоса между языками, управление эмоцией и темпом текстом
• TTS-Next - единый LM+DiT фреймворк: голос, звуковые эффекты и фон в одном проходе
• Realtime - дуплекс с перебиванием, эмпатичное замедление когда чувствует плохое настроение
Для аудиокниг, подкастов, игр, рекламы и живых разговоров. API на qwencloud
qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans
qwencloud.com/models/qwen-audio-3.1-realtime-plus
MAX
Post #14705
1.13K

- 🔥 6
- 👍 1