Qwen выкатила Audio 3.1 — один стек, который закрывает разом ASR, TTS и realtime-аудио.
ASR стал лучше разбирать языки и диалекты, а заодно вычищает повторы и слова-паразиты. ASR-Next уже раскидывает, кто из говорящих кто, проставляет таймкоды, ловит эмоции и звуки вокруг.
TTS умеет переносить голос с языка на язык и крутить стиль, скорость и эмоцию. TTS-Next выдаёт голос, эффекты и фон одним заходом — через связку LM + diffusion. Realtime слушает и говорит одновременно, с нормальными живыми перебиваниями.
И цены срезали прилично: TTS ~−70%, Realtime ~−85%, ASR до −95%.
Qwen-Audio-3.1-ASR
Qwen-Audio-3.1-Realtime
👉 About Python
Post #3168
241
