🔖 DFlash может стать новым бустом для LLM inference
Новая техника speculative decoding заменяет обычную draft-модель на diffusion-based генерацию токенов.
Фишка в том, что черновые токены генерируются параллельно, а не по одному, из-за чего скорость инференса резко растёт.
⛓️ Ссылка на GitHub
tags: #полезное
➡ Data Scientist | Чат
Post #917
637
- ❤ 1
- 👍 1
- 🔥 1