TGViewer
Deep Time Deep Time @deeptimeai · 3.88K subscribers
Post #582 3.43K
معرفی KVarN

گوگل چند وقت پیش یک روش بهینه در مدیریت KV cache به نام TurboQuant معرفی کرد که اساسا خود KV Cache رو کوئانتایز میکرد و بعد برای پروسه attention مجدد تبدیل به دقت بالاتر.

اما vLLM با بنچمارک نشون داد که این کم شدن Memory Usage یا افزایش ظرفیت به قیمت از دست رفتن Accuracy و کم شدن throughput هست. این کاهش دقت خصوصا در long-cotext بیشتر دیده میشه چراکه error ها با این تبدیل به مرور زیاد میشن.

حالا Huawei روش KVarN رو معرفی کرده که نه تنها دقت رو حفظ میکنه بلکه throughput رو افزایش میده و کار اصلیش هم که ۴ برابر کردن ظرفیت KV-cache (حتی این هم بهتر از TurboQuant)
Paper
Github

مزیت برای استفاده: در یک فورک vLLM ارائه شده.
  • 👍 10
  • ❤ 7
  • 🔥 1
More from @deeptimeai
  1. Sep 6, 2026برای "ما انسان ها"، مهم‌تر از نتایج فوق‌العاده از جدیدترین مدل LLM و احتمالا مهم‌تر از تما…
  2. Sep 4, 2026یک علت سرعت بالای Inference در LLM ها استفاده از تکنیک Speculative Decoding هست. دقت کرده…
  3. Aug 12, 2026پیرو بحث قبل، نسل جدیدی از Hedge Fund ها بر مبنای Foundational Model برای Trading در حال ش…
  4. Aug 11, 2026اخیرا یک پروژه رو تحویل دادیم که برای Forecasting سری زمانی بود. نکته جالب اینکه از حدود ۳…
  5. Jul 26, 2026در مورد استاندارد OKF از Google به این پست اضافه کنم که: ۱- این کار گوگل از LLM Wiki آندره…
  6. Jul 18, 2026این آهنگ برای کساییه که توی این دنیای پر از ادعا، بی‌ادعا ترین قشر بودن... به سلامتیِ سربا…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →