معرفی KVarN
گوگل چند وقت پیش یک روش بهینه در مدیریت KV cache به نام TurboQuant معرفی کرد که اساسا خود KV Cache رو کوئانتایز میکرد و بعد برای پروسه attention مجدد تبدیل به دقت بالاتر.
اما vLLM با بنچمارک نشون داد که این کم شدن Memory Usage یا افزایش ظرفیت به قیمت از دست رفتن Accuracy و کم شدن throughput هست. این کاهش دقت خصوصا در long-cotext بیشتر دیده میشه چراکه error ها با این تبدیل به مرور زیاد میشن.
حالا Huawei روش KVarN رو معرفی کرده که نه تنها دقت رو حفظ میکنه بلکه throughput رو افزایش میده و کار اصلیش هم که ۴ برابر کردن ظرفیت KV-cache (حتی این هم بهتر از TurboQuant)
Paper
Github
مزیت برای استفاده: در یک فورک vLLM ارائه شده.
Post #582
3.43K
- 👍 10
- ❤ 7
- 🔥 1