В статье авторы предлагают метод для ускорения синтеза речи на основе популярной модели CosyVoice 2. Она состоит из токенизатора текста и речи, авторегрессивной модели Qwen2.5 0.5B и Flow Matching декодера. Во время инференса ~70% времени уходит на авторегрессивную генерацию токенов, поэтому авторы оптимизируют этот этап. Для ускорения применяют Speculative Decoding
Чем интересна эта работа: она подчеркивает неоднозначность токенов, которые порождают speech tokenizer'ы. Авторы делают предположение, что в отличие от NLP разные последовательности токенов речи могут приводить к одинаковому качеству звучания речи после декодинга. Следовательно, можно смягчить критерий отбора токенов и дополнительно ускорить генерацию
Что делают на практике?
В классическом Speculative Decoding есть медленная и качественная Target Model
q(.|.) и быстрая Draft Model p(.|.). С помощью Draft Model авторегрессивно генерируют токены. С помощью Target Model вычисляют вероятностные распределения для всех сгенерированных префиксов за один проход. Далее выполняют Rejection Sampling, чтобы итоговая последовательность соответствовала распределению Target Model:r ~ uniform(0, 1)
accept x if r < min(1, q(x) / p(x))
else x ~ normalize(max(0, q(x) - p(x)))
Вся схема работает, поскольку:
1) авторегрессивная генерация memory-bound и сгенерировать один токен стоит примерно столько же, что и проверить префикс из нескольких токенов
2) многие токены довольно просто сгенерировать, емкость Target Model для них избыточна
3) схема с Rejection Sampling помогает оставаться в распределении Target Model
Для генерации токенов аудио авторы вводят tolerance factor
β >= 0 и модифицируют критерий следующим образом:r ~ uniform(0, 1)
accept x if r < min(1, q(x) / p(x)) + β
Это позволяет смягчить критерий принятия токенов от Draft Model и добиться лучшей производительности системы при том же качестве синтеза речи. Варьируя
β, можно регулировать компромисс между качеством и скоростьюВ качестве Target Model выступает трансформер на 24 слоя, Draft Model инициализируют последними 6 слоями (19–24), и дообучают только нижние 2 слоя + lm head
Каких результатов удалось добиться?
Для оценки качества используют объективные (WER: Word Error Rate, Speaker Similarity, NMOS) и субъективные (Mean Opinion Score) метрики. Дообучение Draft Model проводили на датасете LibriTTS, на нем же оценивают качество.
Для оценки производительности используют LM Real Time Factor — отношение времени, которое потребовалось для генерации токенов аудио, к длительности аудио.
Авторы приходят к тому, что оптимально генерировать 3 токена с помощью Draft Model и использовать
β=0.4У исходной CosyVoice 2 WER составляет 3.67%, у Draft Model — 16.13%. Speculative Decoding с подобранными параметрами позволяет достичь WER ~ 5.7% и ускорить генерацию на 40% (LM-RTF 0.50 → 0.36). Деградацию WER после Speculative Decoding авторы связывают с датасетом LibriTTS, на котором дообучали Draft Model. Он примерно в 300 раз меньше проприетарного датасета, который использовался в CosyVoice 2.
Важно отметить, что увеличение
β приводит к росту производительности без ушудшения качества, что подтверждает гипотезу об отсутствии однозначного кодирования с помощью аудио токенов.Мы еще вернемся к вам с обзорами интересных статей, а пока предлагаем изучить материалы туториалов и обзорных докладов:
- Beyond End-to-End ASR: Integrating Long-Context Acoustic and Linguistic Insights
- Conversational Agent: Towards Building Collaborative Partners
