DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
[Статья]
По существу работа предлагает инкрементальные улучшения поверх DFlash (наткнулся, когда искал код FLARE), поэтому кратко:
👉 Вместо того, чтобы брать равномерно признаки с какого-то по какой-то слой, делают взвешенное смешивание с обучаемой матрицей.
👉 Разделяют KV проекции для target контекста и драфтовых токенов.
👉 В экспоненциальном затухании весов токенов при удалении вглубь драфта постепенно повышают знаменатель (снижают скорость затухания).
👉 Stack more layers and train on more (3x) data 😝.
В итоге оно дает 5-10% ускорения против DFlash.
Post #743
1.79K

- 👍 9
- 🤔 4