TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10899 19.5K
✔️ Tencent релизнула одну модель на все задачи с речью

Tencent Hunyuan вместе с Шанхайским университетом выложили AuK, открытую базовую модель для генерации и редактирования речи на 1,5 млрд параметров.

Русского языка модель не знает, заявлены только китайский и английский. Авторы, правда, отмечают возможный перенос между языками - какая-то способность возникает сама, но поддержкой это не считается.


AuK принимает на вход текстовый запрос и, если нужно, исходное аудио и на выходе отдаёт готовый звук.

Всего заявлено пять типов задач: синтез речи (клонирование голоса по образцу и генерация по описанию), правка содержания (заменить слово в реплике или строчку в песне), акустика (темп, громкость, высота тона), паралингвистика (эмоция, тембр, акцент, вздохи и смешки, шёпот) и очистка с разделением (шумоподавление, выделение спикера, отделение вокала от музыки).

🟡Механика

Мультимодальная Qwen2.5-Omni читает инструкцию вместе с аудио и превращает её в смысловое условие. Аудио-VAE сжимает звук в компактное представление и потом восстанавливает обратно в волну.

Между ними работает трансформер по подобию FLUX - сначала десять блоков MMDiT, где смысловой и акустический потоки обмениваются информацией, оставаясь раздельными, затем двадцать обычных блоков DiT поверх склеенной последовательности.

🟡Тесты

По замерам Tencent, модель лидирует на Seed-TTS-Eval (разборчивость речи и похожесть на голос образца), InstructTTSEval (насколько точно модель отрабатывает словесное описание тембра), а также на MMAE-Speech и SpeechEditBench, где проверяют правки.

А вот на восстановлении сигнала (DNS Challenge, CHiME-4, Libri2Mix) она только конкурентоспособна, то есть узкоспециализированные модели там по-прежнему сильнее.

Отдельно выложена AuK-Flash - дистиллированная версия, которая укладывается в четыре шага вместо тридцати двух и работает в 4,5 раза быстрее.

К ней, кстати, нужно будет отдельно качать Qwen2.5-Omni-3B в роли энкодера.


В репозитории есть код установки, инференса на Gradio, ComfyUI, дообучения и шаблоны инструкций с примерами в кукбуке.

Пощупать можно в демо на Hugging Face и ModelScope.


📌Лицензирование: MIT License


🟡Страница проекта
🟡Веса
🟡Arxiv
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #TTS #AuK #Tencent
  • 👍 59
  • 🤗 17
  • ❤ 14
  • 👏 13
  • 🔥 1
More from @ai_machinelearning_big_data
  1. Sep 25, 2026✔️ Google добавила в Gemini 3.8 Live говорящий видеоаватар Gemini 3.8 Live with Live Avata…
  2. Sep 25, 2026Появилось открытое сообщество для решения NetHack Исследователи из AIRI зовут объединяться…
  3. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
  4. Sep 25, 2026⚡️ OpenAI готовит подписку ChatGPT Pro Max Согласно утечкам из кодовой базы сервиса, в бли…
  5. Sep 25, 2026AIJ Contest 2026: реши реальные задачи и получи возможность забрать свой кусок 10-миллионн…
  6. Sep 25, 2026✔️ Cursor сократил расход токенов Anysphere переработала обвязку своего агента и снизила т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →