TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10579 24.8K
Alibaba выпустила Qwen-Audio-3.0-TTS - новую модель для синтеза речи

Доступны две версии:

* Flash - для голосовых интерфейсов в реальном времени
* Plus - для генерации с упором на естественность и точную передачу тембра

Модель поддерживает 16 языков, включая русский. Стиль речи можно задавать обычным текстом: например, попросить читать медленно, спокойно или как сказку перед сном.

В текст также встраиваются управляющие теги: [angry], [whispers], [laughing], [sighing] и другие. Всего добавлено 86 тегов для управления эмоциями, темпом и неречевыми звуками.

Qwen-Audio-3.0-TTS умеет клонировать голос даже по шумной записи и генерировать до трёх минут аудио за один проход. Версия Plus сейчас занимает первое место в рейтинге Artificial Analysis TTS Arena.

Блог и примеры: https://funaudiollm.github.io/qwen-audio-3.0-tts/
Документация API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide
  • 👍 104
  • ❤ 30
  • 🔥 15
  • 👏 14
  • 🎉 7
  • 🤗 2
  • 🗿 1
More from @ai_machinelearning_big_data
  1. Sep 30, 2026🔥 Google официально представила Gemini 4 Argon Это новая frontier-модель компании для сло…
  2. Sep 30, 2026✔️ Nvidia представила открытую платформу безопасности для агентов Open Agent Safety Platfo…
  3. Sep 30, 2026Осень — время, когда бизнес активно начинает искать подрядчиков: бухгалтеров, юристов, мар…
  4. Sep 30, 2026✔️ Google заменит Gems в Gemini на Skills Личные аккаунты Google перейдут на новый формат…
  5. Sep 30, 2026Разработка модели компьютерного зрения не всегда начинается с кода. Иногда больше времени…
  6. Sep 30, 2026✔️ AMD покупает World Labs Стартап Фей-Фей Ли, который с 2024 года разрабатывает модели пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →