LMCacheKV缓存加速层
LMCache 是一个用于 LLM 推理的 KV 缓存管理层,旨在降低首 token 延迟并提升吞吐。
- 引擎独立部署:作为独立守护进程管理 KV 缓存,推理引擎崩溃时缓存不丢失。
- 分层持久化离线与复用:将 KV 缓存从 GPU 移至 CPU 内存、本地存储或远端后端,支持跨请求、会话和引擎实例复用。
- 可插拔存储与传输后端:兼容 CPU RAM、SSD、Redis/Valkey、S3 等多种存储,并通过 NIXL、RDMA 等传输实现 KV 传输。
GitHub
#GitHub #开源
📢 频道:@GitHubTrendingHub
Post #138
12
