TGViewer
Speech Info Speech Info @speechinfo · 1.38K subscribers
Post #139 912
DisTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation

Дискретные токены по-прежнему тяжело моделировать и реконструировать: подробнее об этом мы говорили в посте о фреймворке DiTAR. А сегодня разберём статью об очень похожем решении — DiSTAR, фреймворке для zero-shot text-to-speech.

Авторы вдохновлялись LLaDA, где используют диффузионный подход. Но вместо обычных одноуровневых текстовых токенов используют RVQ (residual vector quantization):

- Их битрейта достаточно для качественной реконструкции.
- Из-за дискретности их обучение так же стабильно и интерпретируемо, как и классических LLM.

Авторы утверждают, что известные подходы к моделированию RVQ жертвуют либо скоростью инференса, либо долгосрочной консистентностью. Чтобы решить эту проблему, авторегрессионную языковую модель с маскированной диффузией учат предсказывать токены в дискретном RVQ-пространстве:

1. Формируют из RVQ-токенов патчи, как в DiTAR, и подают их на вход агрегатору — трансформерному энкодеру, который сжимает каждый патч до одного вектора.

2. Авторегрессионный каузальный трансформер учится моделировать непрерывные представления — на каждом шаге обрабатывает сжатый вектор из агрегатора с учётом предыдущего контекста. Новый вектор подаёт в диффузию в качестве контекста.

3. Маскированная диффузионная модель предсказывает следующий патч RVQ-токенов по скользящему окну предшествующих токенов и выходу трансформера.

RVQ-токены порождают гораздо меньше ошибок реконструкции, чем одноуровневый VQ. Моделировать их можно разными способами. В поисках трейд-оффа между качеством работы модели и скоростью её инференса авторы нашли работоспособный вариант с адекватным компьютом: связка авторегрессионного трансформера с маскированной диффузией позволяет совместно моделировать временные и послойные зависимости RVQ.

Александр Плахин ❣ Специально для Speech Info
  • 👍 12
  • 🔥 9
  • ❤ 7
More from @speechinfo
  1. Oct 1, 2026Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs Сегодня р…
  2. Sep 23, 2026Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs Инф…
  3. Sep 17, 2026Voice Memory for Agentic Speech Recognition Сегодня разбираем работу от NVIDIA о том, как…
  4. Sep 10, 2026OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models Сег…
  5. Sep 2, 2026MOSS-TTS Technical Report Разбираем техрепорт MOSS-TTS. В нём генерацию речи пытаются свес…
  6. Aug 26, 2026Как научить машину слышать «естественно»: GSRM и UniSRM [2/2] В SpeechJudge, которую мы уж…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →