分页注意力究竟何时才能真正发挥作用?
分页注意力在处理长序列或大量并发请求的服务负载时表现出色,因为它消除了传统KV缓存整体分配带来的内存浪费。在2024年的一项研究中,分页注意力相比FasterTransformer和Orca等先进系统实现了2至4倍的吞吐量提升,且随着序列变长、模型变大,收益还会进一步增加[4]。这意味着,如果你正在服务带有长对话历史的聊天机器人或基于文档的问答系统,分页注意力无疑是一个明显的优势。
2025年在NVIDIA L4 GPU上进行的一项基准测试显示,采用分页注意力机制后,当序列长度从128个token增加到2048个token时,推理延迟仅呈线性增长(约2倍),而相比之下,未使用缓存时延迟呈指数增长[2]。因此,这种优势在上下文较长且长度多变时最为显著——而这正是检索增强生成(RAG)或多轮工具调用会向上下文中添加更多token的场景。
为何将分页注意力与符号工具、模拟器或检索结合使用?
分页注意力是一种内存管理技术,而非推理引擎。它能释放GPU内存并加速注意力计算,但并不能帮助模型决定检索什么内容或如何运行模拟。因此,当你的任务同时需要这两者时,可以将它们结合使用:长上下文处理(分页注意力在此发挥作用)以及外部知识或多步逻辑(工具在此发挥作用)。例如,一个检索增强系统会拉取大量文档,从而产生庞大的KV缓存;分页注意力能让该缓存保持高效,而检索组件则确保模型获得正确的信息。
一篇2025年的系统论文在vLLM的分页注意力机制之上构建了一个模块化服务栈,添加了压缩路由器和输出路由器等组件,以集成提示压缩及其他优化功能[5]。这表明分页注意力被设计为一个可供其他工具叠加的基础,而非其替代品。类似地,一项2026年关于TPU的研究将分页注意力集成到vLLM和SGLang中作为主要后端,证明了它能够作为生产级基础服务于可能包含额外功能的推理系统[1]。
何时应跳过组合?
如果你的工作负载是短上下文、单轮对话,分页注意力的优势就会缩小,而加入检索或模拟器可能只会增加延迟,却得不到回报。2026年的一项研究发现,对于短序列(512–4096个token),分页注意力相比基线能带来2.0–2.5倍的吞吐量提升,但代价是峰值内存预留高出2.2倍[3]。如果你的上下文较短,且不需要外部工具,那么这种内存开销可能并不值得。
另外,如果你的瓶颈不是内存,而是注意力计算本身,那么你可能需要的是算法稀疏性,而不是分页。2025年一篇关于渐进式稀疏注意力的论文表明,通过按token和层自适应地减少KV缓存使用量,与未采用稀疏注意力的系统相比,KV缓存使用量最多可减少8.8倍,吞吐量最多可提升2.0倍[6]。这与分页注意力是不同的杠杆——所以如果你的问题是注意力速度,而非内存碎片化,那么应考虑使用稀疏注意力,而不是分页,或两者并用。
关于这些资料来源
这个回答基于6项研究(1篇同行评审,5篇预印本)——发表于2024年至2026年间,其中6篇为2024年或之后发表——这些研究是从8项通过质量筛选的研究中选出的最相关者,而这8项研究又源自从超过5亿篇论文数据库中检索到的51篇文献。
本文引用的文献
Ragged Paged Attention:面向TPU的高性能、灵活的大语言模型推理内核
Ragged Paged Attention(RPA)在TPU上实现了解码阶段高达86%的内存带宽利用率和预填充阶段73%的模型FLOPs利用率,并已作为vLLM和SGLang中的主要TPU后端集成,证明了分页注意力在非GPU硬件上同样有效。
分页注意力遇上FlexAttention:解锁部署推理中的长上下文效率
将IBM FMS中的PagedAttention与FlexAttention集成,可将序列长度在128至2048个token范围内的推理延迟增长控制在约2倍,而在NVIDIA L4 GPU上,若不使用缓存,延迟则呈指数级增长。
通过统一KV缓存优化扩展长上下文大语言模型:分页注意力与量化方法的比较研究
在Mistral-7B的单批次对比测试中,vLLM的PagedAttention相比FP16基线实现了2.0–2.5倍的吞吐量提升,但峰值内存占用高出2.2倍;而KV量化仅将内存减少不到2%,却导致吞吐量下降55–89%。
面向大语言模型(LLMs)服务的高效内存缩减管理:基于Paged Attention的KV缓存共享的Open-AI模型
PagedAttention实现了近乎为零的KV缓存浪费和灵活的共享机制,相较于FasterTransformer和Orca,吞吐量提升了2–4倍,且在更长序列和更大模型上收益更为显著。
面向资源高效的LLM推理服务,进行机器学习与系统的协同设计
一个系统协同设计项目在vLLM的分页注意力机制之上构建模块化组件(压缩路由器、输出路由器),以集成提示压缩和量化等优化,旨在实现自适应服务。
渐进式稀疏注意力:面向大语言模型服务中高效注意力机制的算法与系统协同设计
渐进式稀疏注意力(PSA)能够根据每个词元和每一层自适应地调整KV缓存预算,与未采用稀疏注意力的系统相比,KV缓存使用量最多可减少8.8倍,吞吐量最多可提升2.0倍。
