🖥 NVIDIA показала TwoTower - способ заметно ускорить LLM без сильной потери качества.
Обычные autoregressive-модели генерируют токены по одному - качественно, но медленно. Diffusion-подходы могут генерировать целые блоки параллельно, но обычно теряют в качестве.
TwoTower разделяет эти две задачи.
Первая башня - замороженная context-модель, которая читает уже существующий текст и сохраняет возможности исходной autoregressive-модели.
Вторая - trainable denoiser, который параллельно восстанавливает следующий блок токенов и на каждом слое обращается к соответствующему слою context tower через cross-attention.
По данным авторов:
- до 2,42× выше throughput генерации
- сохраняется 98,7% качества исходной модели
- основа - 30B hybrid Mamba-Transformer MoE
- адаптация обучалась примерно на 2,1T токенов против 25T токенов исходного pretraining
При этом модель не обучали с нуля - TwoTower строится поверх уже существующей autoregressive-модели.
То есть можно сохранить сильную базовую модель, но заменить медленную генерацию по одному токену на параллельную генерацию блоками.
Код и веса открыты.
https://arxiv.org/pdf/2606.26493
Post #2985
4.06K
- ❤ 10
- 👍 10
- 🔥 6