PagedAttention:用虚拟内存破解KV缓存碎片化,大模型GPU并发推理提升2-4倍
thinkindev • 2026-08-21
1142 views
在大模型自回归推理过程中,KV缓存用于保存每个请求的注意力键值对,避免每一步解码都重新计算。但随着序列长度增加,KV缓存会线性膨胀,长上下文场景下甚至会消耗比模型权重更多的GPU显存,成为稀缺资源。更严重的是,默认分配方式会产生大量碎片,实际被浪费的KV缓存空间可达60%到80%。PagedAttention借鉴操作系统虚拟内存的分页机制,将KV缓存按固定大小的块进行管理,并通过页表映射支持非连续存储,从而显著降低碎片化。这一设计使注意力内核仍能高效访问分页后的KV数据,最终在相同GPU资源下可支撑2到4倍的并发请求,为大模型推理服务的吞吐量优化提供了关键路径。
核心要点
- PagedAttention借鉴操作系统虚拟内存分页机制管理KV缓存,减少显存碎片化浪费
- 该技术可将KV缓存浪费从60%-80%大幅压缩,并提升2-4倍并发请求处理能力
- KV缓存随长上下文线性增长已成为大模型推理的关键瓶颈,分页设计让注意力内核适配非连续存储