DFlash — это легковесная блочная диффузионная модель, которая ускоряет работу больших языковых моделей, таких как Qwen3.5 и Llama, с помощью спекулятивного декодирования, генерируя черновые токены параллельно для более чем 6-кратного ускорения вывода без потери качества — до 2,5 раз лучше, чем у лучших методов.
🐱 GitHub
Post #10491
11.8K

- ❤ 15
- 🤔 5
- 🔥 2