Один KV-кеш на все слои LLM — не лучший вариант
29 сентября Apple представила KV-Kaizen — метод, который подбирает схему сжатия KV-кеша отдельно для каждого слоя и конкретного промпта.
Небольшой селектор решает:
⏩ какие слои могут использовать общий кеш;
⏩ сколько бит выделить значениям;
⏩ до какого ранга сократить их представление.
Он запускается один раз перед prefill и занимает около 3 мс. В тестах кеш моделей от 7B параметров удалось уменьшить в 4 раза без заметной потери точности. Для Qwen2.5-14B комбинация метода с удалением токенов дала 32-кратное сокращение: результат на SQuAD снизился с 0,543 до 0,531.
Для тебя здесь важен принцип: KV-кеш стоит распределять как бюджет, а не одинаково сжимать каждый слой. Это позволяет держать больше параллельных длинных контекстов и снижать нагрузку на память при декодировании.
Но метод требует совместного дообучения селектора и модели — это пока не готовая оптимизация, которую можно включить одной настройкой.
Исследование KV-Kaizen от 29 сентября 2026 года
#llm #kvcache #inference #modelcompression #longcontext #apple
@data_engi
Post #1381
187