分页注意力机制之前,哪里出了问题?
在分页注意力机制出现之前,大语言模型(LLM)服务系统将键值(KV)缓存——即存储对话上下文的内存——视为每个请求对应的一大块连续内存进行管理。这导致了严重的碎片化问题:内存被浪费在空隙中,请求无法高效地批量处理,从而限制了吞吐量。2023年提出的原始PagedAttention论文表明,通过借鉴操作系统中的分页思想——将内存划分为固定大小的块——vLLM实现了KV缓存内存近乎零浪费,并将吞吐量相较于FasterTransformer和Orca等最先进系统提升了2至4倍[1]。这就是基础所在:分页注意力将内存管理问题转化为调度问题,而这一转变正是推动下一波改进的关键。
分页注意力如何超越原始设计,持续演进?
最初的PagedAttention是为GPU设计的,但同样的思路如今正被适配到其他硬件上,并得到进一步优化。2025年的一篇论文将PagedAttention与PyTorch的FlexAttention集成,结果表明,在NVIDIA L4 GPU上,当序列长度从128个token增加到2048个token时,推理延迟仅呈线性增长(约2倍),而此前无缓存时则呈指数增长[2]。这意味着长上下文请求不再像过去那样导致响应时间急剧飙升。另一篇2026年的论文为Google的TPU引入了Ragged Paged Attention(RPA),在Llama 3 8B上,解码阶段的内存带宽利用率最高可达86%,预填充阶段的模型FLOPs利用率可达73%[3]。这些数字意味着在更便宜的硬件上也能实现更快、更具成本效益的服务,而这正是API提供商在不大幅提价的情况下提供更长上下文所急需的。
为什么调度才是下一个重大突破,而不仅仅是内核?
即使有了出色的注意力内核,跨请求调度工作的方式也可能决定吞吐量的成败。2026年的一项研究PersistentKV发现,最佳的单内核实现并不总是最优的服务调度方案:对于长上下文解码和小批量场景,GPU可能未被充分利用,而混合序列长度会在精确长度启动和填充批次之间产生矛盾[4]。通过采用页感知调度器,仅执行非空任务,他们在典型工作负载上将解码吞吐量提升了1.04–1.08倍,在单请求长上下文跟踪中提升了1.40倍,同时将每步启动次数从16次减少到2次[4]。这表明,如何分配工作与内核本身同样重要——而这正是未来两年优化的重点所在。
用户在实际使用LLM API时,会注意到哪些变化?
对开发者和终端用户而言,实际收益是更快的响应速度和更低的成本。2025年的一项研究对vLLM与Gemma、HuggingFaceTB和Llama模型进行了测试,发现PagedAttention通过减少内存碎片并优化KV缓存管理,显著缩短了推理时间[5]。另一篇2025年的论文追溯了从推荐系统到LLM的演进过程,表明PagedAttention如今已成为服务LLaMA模型基础设施栈中的标准组成部分[6]。未来两年,随着这些优化逐渐成熟,可以预期API将能处理更长的上下文(比如整本书的篇幅)而不会出现延迟激增,同时每token成本也会更低——让先进LLM功能对初创公司和个人爱好者都更加触手可及。
关于这些资料来源
这个回答基于6项研究(3项经同行评审,3项为预印本),发表于2023年至2026年间,其中5项为2024年或之后发表,合计被引用776次。这些研究是从6项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的60篇文献。
本文引用的文献
分页注意力遇上FlexAttention:解锁部署推理中的长上下文效率
原始的PagedAttention论文(2023年)在vLLM中引入了基于块的KV缓存管理,实现了近乎为零的内存浪费,并且相较于FasterTransformer和Orca,吞吐量提升了2–4倍,对于更长的序列和更大的模型,性能提升更为显著。
Ragged Paged Attention:面向TPU的高性能、灵活的大语言模型推理内核
一项2025年的研究将PagedAttention与PyTorch的FlexAttention相结合,在NVIDIA L4 GPU上表明,使用全局KV缓存时,推理延迟从128个token到2048个token仅呈线性增长(约2倍),而无缓存时则呈指数增长。
PersistentKV:面向商品GPU上长上下文LLM服务的页感知解码调度
一篇2026年的论文提出了面向TPU的Ragged Paged Attention(RPA)方法,在Llama 3 8B模型上,解码阶段实现了高达86%的内存带宽利用率,预填充阶段实现了73%的模型FLOPs利用率,并将其作为vLLM和SGLang中的主要TPU后端集成。
针对大语言模型服务的高效内存管理:PagedAttention
2026年的一项研究PersistentKV表明,页面感知调度可将典型工作负载的解码吞吐量提升1.04–1.08倍,在单请求长上下文轨迹上提升1.40倍,同时将每步启动扇出从16次降至2次。
扩展AI基础设施:从推荐引擎到基于分页注意力的大语言模型部署
2025年对vLLM与Gemma、HuggingFaceTB和Llama模型的评估发现,PagedAttention通过减少内存碎片和优化KV缓存管理,显著缩短了推理时间,使其适用于实时聊天机器人。
使用vLLM加速聊天机器人推理:评估PagedAttention的效率
一篇2025年的文章追溯了从推荐系统到大型语言模型部署的演进过程,将vLLM中实现的PagedAttention作为应对内存管理挑战的关键解决方案,并为服务LLaMA模型提供了实用指南。
