TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10727 20.6K
🌟 MiDashengLM-Gen: генерация комплексных звуковых сцен

Команда MiLM Plus из Xiaomi опенсорснула генератор звука по текстовому описанию, который создаёт целостные аудиосцены из речи, музыки, звуковых эффектов и фоновой акустики окружающей среды.

Под капотом - собственный аудиотокенизатор MiDashengLM-0.6B, построенный по архитектуре DashengTokenizer, и дообученная языковая модель Qwen3-1.7B, работающие в связке с Flow matching на базе DiT.

Данные для обучения из двух источников: первый - приватный суперсет ACAVCaps на 77 тысяч часов с речью, музыкой и эффектами, второй - микс TTS-корпусов Emilia, LibriTTS, LJSpeech, AISHELL-3, WenetSpeech4TTS.

Русский язык модель знает, в речевой части ACAVCaps его доля 4,66%, но основа обучения всё же английский (54%) и китайский (24,5%). В TTS-сетах русского нет вообще, и это видно по качеству (13,19% ошибок против 2,42% на английском).

Управление в промпте задаётся тегами:

<|caption|> - описание всей сцены;
<|asr|> - текст для озвучки голосом;
<|speech|> - тон, эмоции, стиль голоса;
<|sfx|> - звуковые эффекты;
<|music|> - описание музыки;
<|env|> - окружающая среда.

Указывать нужно все, а если поле неприменимо, туда идёт <|unknown|>. У чистой речи, например, заглушки стоят в полях музыки и эффектов.

Смысл в том, чтобы управляющие факторы не слипались друг с другом. Модель видит явное разделение и не пытается вывести стиль говорящего из описания фонового шума.

На выходе - трек в формате WAV с частотой дискретизации 16 кГц. Длина ограничена до 20 секунд, на более длинных таймингах модель не проверяли.

🟡Тесты

Прямых аналогов среди открытых моделей почти нет, поэтому авторы сопоставляют систему с узкоспециализированными по каждой задаче и со своим же предшественником Dasheng AudioGen.


Основная причина для гордости - разборчивость речи. На английском Seed-TTS доля ошибок упала с 12,15% до 2,79%. Мультиязычность тоже подтянулась, но до уровня Qwen3-TTS и Seed-TTS система не дотягивает.

Вин-стрик по эмоциям на CV3-Eval, где эмоция подсказана текстом, - 0,98 радость, 0,96 грусть, 0,92 злость.

По генерации отдельных звуков в AudioCaps система уступает TangoFlux (FAD 5,01 против 2,26).

В планах - клонирование голоса, подтягивание низкоресурсных языков и управление по времени.


📌Лицензирование: Apache 2.0 License



🟡Страница проекта
🟡Веса
🟡Arxiv
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #TTA #TTS #TTSFX #MiDashengLM #Xiaomi
  • 🤓 29
  • 👍 26
  • ❤ 8
  • 🤔 5
  • 🔥 3
  • 👀 1
More from @ai_machinelearning_big_data
  1. Sep 26, 2026✔️ Апелляционный суд США оставил Anthropic в чёрном списке Пентагона Суд округа Колумбия п…
  2. Sep 26, 2026📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science р…
  3. Sep 25, 2026✔️ Google добавила в Gemini 3.8 Live говорящий видеоаватар Gemini 3.8 Live with Live Avata…
  4. Sep 25, 2026Появилось открытое сообщество для решения NetHack Исследователи из AIRI зовут объединяться…
  5. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
  6. Sep 25, 2026⚡️ OpenAI готовит подписку ChatGPT Pro Max Согласно утечкам из кодовой базы сервиса, в бли…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →