TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2658 4.3K
LongCat-AudioDiT - новая SOTA диффузионная TTS-модель от Meituan.

Модель генерирует речт напрямую в латентном пространстве аудиоволн (waveform latent space), без авторегрессии → меньше накапливаемых ошибок.
Ключевое:

Архитектура: Wav-VAE + Diffusion
Размеры: 1B и 3.5B параметров
Языки: китайский + английский
SOTA по клонированию голоса (SIM: 0.818 / 0.797 на Seed-ZH / Seed-Hard)
Алгоритм APG вместо CFG — лучшее качество и естественность звука
Решена проблема несоответствия обучения и инференса в диффузионных TTS

Неочевидный вывод: лучший VAE ≠ лучший TTS

📄 Tech Report: https://github.com/meituan-longcat/LongCat-AudioDiT/blob/main/LongCat-AudioDiT.pdf
🐙 GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
🤗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
  • 👍 8
  • ❤ 5
  • 🔥 1
More from @machinelearning_interview
  1. Sep 25, 2026Сингулярность
  2. Sep 25, 2026📋 Китай впервые обошёл США по числу ведущих ИИ-исследователей По данным нового исследован…
  3. Sep 25, 2026Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигна…
  4. Sep 25, 2026🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах Новый run-asser…
  5. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
  6. Sep 24, 2026🤖 Microsoft открыла данные, на которых можно учить ИИ управлять роботом. Датасет libero-d…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →