aquakv
В репозитории опубликован код AQUA-KV — метода сжатия Key-Value cache для больших языковых моделей при работе с длинным контекстом. Ключевая идея AQUA-KV — использовать внутренние зависимости самого кэша. Авторы показывают, что в современных LLM есть сильная взаимосвязь как между соседними слоями, так и между ключами и значениями внутри одного слоя. На этой основе строится схема адаптивной квантизации, где компактные линейные предсказатели пытаются восстановить часть информации из уже имеющихся компонент, а квантизации подвергается только остаток, который нельзя хорошо предсказать. Эксперименты на современных моделях семейства Llama и других LLM показывают, что AQUA-KV даёт особенно сильный выигрыш в режиме жёсткого сжатия. На Llama 3.x метод превосходит KVQuant при сопоставимом или даже меньшем числе бит на значение: например, для моделей на 3B, 8B и 70B параметров средний результат на 14 задачах LongBench оказывается выше при 2.09 бита против 2.33 бита у базовой альтернативы. В аннотации авторы отдельно подчёркивают, что на Llama 3.2 удаётся получить почти без потерь качество при 2–2.5 битах на значение, с относительным ухудшением менее 1% по perplexity и LongBench. Метод также совместим с практическими сценариями инференса: поддерживаются recent-token buffer, model parallelism, offloading, speculative decoding и комбинация с pruning-подходами вроде H2O. Работа будет полезна исследователям и инженерам, которые занимаются эффективным инференсом LLM, обслуживанием длинного контекста и оптимизацией памяти в продакшене.
статья | код
Post #151
575

- ❤ 6
- 🔥 4
- 👍 3
- 😍 1