KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
[Статья][Репозиторий]
Увесистые 🏋️ KV-кэши, линейно растущие с длиной последовательности, являются основной причиной дороговизны инференса языковых моделей.
Человечество придумало разнообразные техники сжатия KV-кэшей - прунинг токенов, квантизацию в низкую битность, низкоранговые проекции, но идеального решения с точки зрения качества/производительности/удобства интеграции не было найдено.
В данной статье исследователи предлагают новый метод сжатия KV-кэшей посредством выбрасывания наименее информативных токенов, выдающий state-of-the-art баланс между качеством 🥇 и скоростью 🏃.
Post #628
1.87K

- ❤ 7