您实际应该比较哪些吞吐量和延迟数据?
公平的评估必须在相同工作负载下同时衡量吞吐量(每秒处理的请求数)和延迟(首令牌时间及令牌间时间)。与FasterTransformer和Orca等系统相比,分页注意力可将吞吐量提升2–4倍,但这种提升并非没有代价——如果调度不当,可能会引入延迟抖动[4][3]。例如,FlashInfer报告称,与编译器后端相比,其令牌间延迟(生成每个令牌之间的间隔)降低了29–69%,这直接改善了用户感知的速度[1]。然而,分块预填充——一种交错执行预填充和解码阶段的技术——可以减少生成停顿,但如果调优不当,可能会增加整体延迟[3]。因此,公平的测试应在相同的请求模式下同时报告吞吐量和延迟百分位数(例如,p50、p95)。
如何衡量内存效率与可扩展性?
内存效率是分页注意力(paged attention)的核心承诺,因此公平的评估必须量化节省了多少内存,以及这如何转化为更大的批处理规模或更长的序列。分页注意力通过消除碎片化并支持跨请求共享,实现了KV缓存内存的近零浪费[4]。这使得更多请求能够装入GPU内存,从而提升吞吐量。但内存节省可能被量化开销所抵消——例如,量化KV缓存可以降低内存使用,但可能增加计算成本,正如一项基于vLLM的研究所示,该研究在保持准确率的同时将吞吐量提升了最高18%[2]。公平的测试应衡量每个请求的内存占用、峰值内存使用情况,以及批处理规模如何随内存约束扩展。
为什么工作负载对公平测试如此重要?
分页注意力的收益高度依赖于工作负载,因此公平的评估必须使用多样且真实的工作负载,涵盖不同的序列长度、请求到达率和并发度。相关论文表明,在更长的序列、更大的模型以及更复杂的解码算法下,改进效果更为显著[4]。例如,FlashInfer在长上下文推理中实现的28%–30%延迟降低,凸显了收益并非在所有场景下都一致[1]。此外,与vLLM和SGLang等服务框架的集成也会影响结果——FlashInfer的负载均衡调度旨在处理动态用户请求,同时保持与需要静态配置的CUDAGraph的兼容性[1]。因此,公平的测试应同时包含内核级基准测试和端到端服务基准测试,正如FlashInfer所做的那样,以全面反映实际情况。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2025年间,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的48篇文献。
本文引用的文献
FlashInfer:面向大语言模型推理服务的高效可定制注意力引擎
FlashInfer是一款集成于SGLang、vLLM和MLC-Engine中的注意力引擎,与最先进的推理服务方案相比,其报告显示:token间延迟降低29–69%,长上下文推理延迟降低28–30%,并行生成速度提升13–17%。
基于vLLM推理引擎的KV缓存组量化
一种基于vLLM的KV缓存组量化方法,在LLaMA2-7B、LLaMA3-8B和DeepSeek-R1-Distill-LLaMA3-8B模型上将推理吞吐量提升了最高18%,同时保持了较低的精度损失。
通过分块预填充实现高效的大语言模型推理
分块预填充将大型预填充计算拆分为较小的块,并与解码操作交错执行,能够在严格的延迟约束下提升服务容量并减少生成停顿,但需要精心调度以避免延迟抖动。
面向大语言模型(LLMs)服务的高效内存缩减管理——基于共享KV缓存的分页注意力机制的Open-AI模型
分页注意力机制在KV缓存内存上实现了近乎零浪费,并支持灵活共享,相较于FasterTransformer和Orca,吞吐量提升了2–4倍,且序列越长、模型越大,增益越显著。
公平、实用且高效的大语言模型服务碳核算方法
LLM服务中碳归因的一个框架以Shapley值作为基准,并从可扩展性、公平性、样本效率和激励性等方面评估各种方法,强调简单的留一法无法满足效率属性。
