TGViewer
GigaDev — разработка GigaChat GigaDev — разработка GigaChat @gigadev_channel · 5.24K subscribers
Post #42 3.02K
📝 Инсайты с InterSpeech: Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding

В статье авторы предлагают метод для ускорения синтеза речи на основе популярной модели CosyVoice 2. Она состоит из токенизатора текста и речи, авторегрессивной модели Qwen2.5 0.5B и Flow Matching декодера. Во время инференса ~70% времени уходит на авторегрессивную генерацию токенов, поэтому авторы оптимизируют этот этап. Для ускорения применяют Speculative Decoding

Чем интересна эта работа: она подчеркивает неоднозначность токенов, которые порождают speech tokenizer'ы. Авторы делают предположение, что в отличие от NLP разные последовательности токенов речи могут приводить к одинаковому качеству звучания речи после декодинга. Следовательно, можно смягчить критерий отбора токенов и дополнительно ускорить генерацию

Что делают на практике?
В классическом Speculative Decoding есть медленная и качественная Target Model q(.|.) и быстрая Draft Model p(.|.). С помощью Draft Model авторегрессивно генерируют токены. С помощью Target Model вычисляют вероятностные распределения для всех сгенерированных префиксов за один проход. Далее выполняют Rejection Sampling, чтобы итоговая последовательность соответствовала распределению Target Model:
r ~ uniform(0, 1)

accept x if r < min(1, q(x) / p(x))

else x ~ normalize(max(0, q(x) - p(x)))


Вся схема работает, поскольку:
1) авторегрессивная генерация memory-bound и сгенерировать один токен стоит примерно столько же, что и проверить префикс из нескольких токенов
2) многие токены довольно просто сгенерировать, емкость Target Model для них избыточна
3) схема с Rejection Sampling помогает оставаться в распределении Target Model

Для генерации токенов аудио авторы вводят tolerance factor β >= 0 и модифицируют критерий следующим образом:
r ~ uniform(0, 1)

accept x if r < min(1, q(x) / p(x)) + β


Это позволяет смягчить критерий принятия токенов от Draft Model и добиться лучшей производительности системы при том же качестве синтеза речи. Варьируя β, можно регулировать компромисс между качеством и скоростью

В качестве Target Model выступает трансформер на 24 слоя, Draft Model инициализируют последними 6 слоями (19–24), и дообучают только нижние 2 слоя + lm head


Каких результатов удалось добиться?
Для оценки качества используют объективные (WER: Word Error Rate, Speaker Similarity, NMOS) и субъективные (Mean Opinion Score) метрики. Дообучение Draft Model проводили на датасете LibriTTS, на нем же оценивают качество.

Для оценки производительности используют LM Real Time Factor — отношение времени, которое потребовалось для генерации токенов аудио, к длительности аудио.

Авторы приходят к тому, что оптимально генерировать 3 токена с помощью Draft Model и использовать β=0.4

У исходной CosyVoice 2 WER составляет 3.67%, у Draft Model — 16.13%. Speculative Decoding с подобранными параметрами позволяет достичь WER ~ 5.7% и ускорить генерацию на 40% (LM-RTF 0.50 → 0.36). Деградацию WER после Speculative Decoding авторы связывают с датасетом LibriTTS, на котором дообучали Draft Model. Он примерно в 300 раз меньше проприетарного датасета, который использовался в CosyVoice 2.

Важно отметить, что увеличение β приводит к росту производительности без ушудшения качества, что подтверждает гипотезу об отсутствии однозначного кодирования с помощью аудио токенов.

Мы еще вернемся к вам с обзорами интересных статей, а пока предлагаем изучить материалы туториалов и обзорных докладов:
- Beyond End-to-End ASR: Integrating Long-Context Acoustic and Linguistic Insights
- Conversational Agent: Towards Building Collaborative Partners
  • ❤ 9
  • 🔥 8
  • 👍 3
  • ❤‍🔥 2
  • 🤔 2
More from @gigadev_channel
  1. Sep 10, 2026🧠 GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями Выкладываем в…
  2. Aug 25, 2026💵 GigaEmbeddings: новая линейка моделей от 480M до MoE-флагмана 10B-A1.8B Мы обновили всю…
  3. Jul 27, 2026💚Хотите познакомиться с командой GigaChat лично? Встречаемся 29 июля! Никаких докладов и…
  4. Jul 14, 2026GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного конте…
  5. Jul 6, 2026💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее Сегодня мы выкладываем в open source GigaC…
  6. Jul 2, 2026💵 GFusion: как мы обучали диффузионную LLM в GigaChat «А что, если LLM будет генерировать…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →