Long-Context KV Cache Systems
结论
- 2023 年是系统化 KV cache 管理的起点。 SOSP 2023 的 PagedAttention 把操作系统分页思想引入 KV cache,之后研究迅速分成内存管理、压缩/稀疏、跨请求复用、分层存储和跨节点传输几条路线。2021—2022 年的顶会工作更多是 Transformer/LLM serving 基础设施,例如 OSDI 2022 的 Orca,不是专门的 KV cache 管理方案。
- 长上下文使问题从“显存分配”演化成“分布式数据系统”。 Mooncake、Strata、SYMPHONY、LMCache 等工作把 KV cache 放进 GPU HBM、CPU DRAM、SSD、远程内存和网络构成的层级中,并联合设计缓存、I/O 和调度。
- P/D 解耦把 KV cache 变成网络负载。 DistServe、Splitwise 先建立 Prefill/Decode 分离范式,CacheGen、HACK、KVDirect、KVServe、DualPath 和 KVCodec 则直接优化 KV 的压缩或传输路径。
- “直驱”有多种不同语义。 需要区分 GPU Direct Storage、GPU RDMA、GPU 直接访问 CPU/CXL 内存、网络内聚合,以及华为 CloudMatrix384 的 AIV-Direct;它们旁路的组件和服务的数据类型并不相同。
核心必读
以下清单优先覆盖“设计范式发生变化”的工作,而不是把所有 KV 压缩算法都纳入主线。
与 AIV-Direct 相近的数据路径
这些工作未必都以 KV cache 为唯一对象,但都在尝试让加速器、网络或存储设备直接发起/完成数据移动或近数据计算,是理解“直驱”设计空间的关键对照。
| 论文 | 会议或状态 | 直通语义 | 与 KV cache 的关系 |
|---|---|---|---|
| Serving Large Language Models on Huawei CloudMatrix384 | 技术报告,2025 | AIV Core 经 UB 直接写远端 NPU 内存,绕过高启动开销的 SDMA。 | 报告另有 RDMA KV 传输和 UB 分离式缓存池;AIV-Direct 本身主要服务 MoE 通信。 |
| GPU-Initiated On-Demand High-Throughput Storage Access in the BaM System Architecture | ASPLOS 2023 | GPU 直接管理 NVMe 访问的控制与数据路径,降低 CPU 参与。 | 不是 LLM/KV 专用,但属于 GPU 直驱存储的基础架构。 |
| GeminiFS: A Companion File System for GPUs | FAST 2025 | GPU 直接以文件语义访问 NVMe,旁路 CPU 数据路径。 | 不是 KV 专用,可作为 SSD-backed KV 系统的底层对照。 |
| Aqua: Network-Accelerated Memory Offloading for LLMs in Scale-Up GPU Domains | ASPLOS 2025 | 借助网络和空闲 Peer GPU 内存加速 LLM 状态卸载。 | 面向 LLM 内存压力,覆盖 KV 等请求状态,但范围不只 KV。 |
| InstAttention: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference | HPCA 2025 | 通过 GPU↔计算存储设备 P2P,在存储侧执行 Decode Attention。 | KV cache 与 Attention 都下沉到计算存储。 |
| No Buffer, No Bottleneck: Efficient Zero-Copy KV Cache Offloading for Long-Context LLMs | OSDI 2026 | GPU kernel 经 NVLink-C2C 直接访问 CPU 驻留 KV,取消 HBM staging buffer。 | 最接近“KV cache 直访远端层级”的正式顶会工作。 |
| DualPath: Accelerating Agentic LLM Inference by Harvesting Disaggregated KV-Cache Storage I/O | SIGCOMM 2026 | 同时利用 Prefill/Decode 两侧存储路径,并经 RDMA 回传。 | 直接优化分离式 KV cache 的存储与网络 I/O。 |
扩展正式论文
内存、稀疏与量化
复用、存储与跨节点移动
其他正式出版
以下论文已经正式出版,但不属于本文重点列举的顶级会议,因技术相关而保留。
| 论文 | 出版物 | 年份 | 主题关系 | 直接研究 KV cache |
|---|---|---|---|---|
| KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference | Proc. ACM Manag. Data | 2026 | 联合管理 GPU、Host DRAM、SSD 上的 KV 放置与流水线。 | 是 |
预印本与技术报告
以下工作与主题高度相关,但截至检索日期不能标为已在上述顶会正式发表。
| 论文 | 状态 | 主题关系 | 直接研究 KV cache |
|---|---|---|---|
| KVDirect: Distributed Disaggregated LLM Inference | arXiv,2025 | 以 Tensor-centric metadata、GPU RDMA 和 pull-mode 直接跨节点获取 Prefill KV。 | 是 |
| MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool | arXiv,2024 | 用分布式弹性 MemPool 统一 Context Caching 与 P/D 解耦。 | 是 |
| LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference | arXiv/项目技术报告,2025 | 在 GPU、CPU、磁盘、对象存储和网络间提供独立 KV cache 层及控制 API。 | 是 |
| TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale | arXiv,2025 | 让 GPU 通过 CXL load/store/DMA 直接读写机架级共享 KV,绕过 NIC hop。 | 是 |
| Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving | arXiv,2026 | 以 GPU-centric object store 和 GPU io_uring 移除 SSD↔HBM KV 数据及控制关键路径中的 CPU。 |
是 |
| DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference | arXiv,2026;作者标注 to appear at ICDCS 2026 | 结合 page-cache 与 NVMe-direct 双路径,旁路文件系统并重叠 I/O 与 GPU DMA。 | 是 |
| DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference | arXiv,2026 | 让 TMA 异步从远端内存直接取回卸载的 KV/权重至 GPU SMEM。 | 是 |
| Serving Large Language Models on Huawei CloudMatrix384 | arXiv 技术报告,2025 | 包含 P/D 分离、RDMA-plane KV 传输、UB 分布式 DRAM/SSD Context Caching 和 AIV-Direct。 | 是;但 AIV-Direct 本身不是 KV 路径 |
设计路线
- 显存内管理:PagedAttention 解决块分配和碎片;Keyformer、KIVI、QUEST、ALISA、LServe 通过选择、稀疏或量化降低常驻容量和读取带宽。
- 跨请求复用:Prompt Cache 和 PagedAttention 处理前缀或显式模块;CacheBlend、CacheSlide、ContextPilot、DroidSpeak 把复用扩展到非前缀、位置变化或跨模型场景。
- 分层存储:CachedAttention、IMPRESS、Mooncake、Strata、SolidAttention、KVDrive 在 HBM、DRAM、SSD 之间管理生命周期、淘汰和预取。
- P/D 解耦与网络传输:DistServe、Splitwise 奠定架构;DéjàVu、CacheGen、HACK、KVDirect、KVServe、DualPath、KVCodec 优化 KV 跨阶段移动。
- 直连与近数据处理:DirectKV 直接访问 CPU 内存;HiFC 使用 GPU Direct Storage;InstAttention 在 CSD 内执行 Attention;TraCT 使用 CXL 共享内存;Turbo 使用网络内聚合。
参考入口
Long-Context KV Cache Systems