LLM吞吐量测试在分页注意力服务中可能遗漏什么?

吞吐量测试未能捕捉到LLM服务中分页注意力机制下,受RTT限制的KV缓存传输、调度效应以及内存共享限制。

直接答案

标准吞吐量基准测试可能会在分页注意力(paged attention)方面误导你,因为它们通常运行在快速本地硬件上,并衡量每秒聚合的令牌数,从而掩盖了三个实际瓶颈:(1)在地理分布式部署中,KV缓存传输受限于往返时间(RTT),而非带宽,即使在快速链路上也会降低有效吞吐量[1];(2)最优的注意力内核并不总是最优的调度方案——在特定长上下文工作负载下,页面感知调度可将挂钟吞吐量提升高达1.4倍[3];(3)内存共享和碎片化的收益取决于请求模式,因此单一的吞吐量数字无法告诉你分页注意力在混合或长上下文负载下的表现[2][4]。在这些研究中,一致的信息是:分页注意力的实际性能取决于工作负载和部署环境,因此你需要用自己的流量和网络条件进行测试,而不能仅依赖基准测试。

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么你的吞吐量测试可能漏掉网络瓶颈

大多数针对LLM服务的吞吐量基准测试都在配备高速NVLink或PCIe的单台机器上运行,因此它们假设KV缓存传输受带宽限制。但在地理分布式部署中——预填充和解码运行在不同的机器上——键值(KV)缓存的传输往往受限于往返时间(RTT),而非带宽[1]。这是因为分页注意力将KV缓存存储在非连续的内存块中,而当前的逐块传输机制会按顺序发送这些块,在高RTT环境下,这类似于经典的TCP小发送窗口问题:你是在等待确认,而不是发送数据,因此即使物理链路很快,有效吞吐量也会崩溃[1]。一个不包含网络延迟的吞吐量测试会完全忽略这一点,让你误以为系统在实际生产中的性能比真实情况更好。

最佳注意力内核并不总是最优的调度方案

吞吐测试通常比较单内核实现(如FlashInfer),并假设最快的内核能带来最佳的服务性能。但一项2026年的研究表明,最佳的单内核实现并不总是最优的服务调度方案[3]。对于低活跃批量的长上下文解码,内核可能无法充分利用商用GPU,而混合序列长度则在精确长度启动与粗粒度填充批量之间产生了矛盾[3]。该研究的自适应策略——在FlashInfer、序列拆分和工作队列调度之间进行选择——在B8双峰、均匀和类Zipf工作负载上将同步墙钟吞吐量提升了1.063–1.265倍,在B1分桶轨迹上提升了1.399倍[3]。这意味着仅测量内核的吞吐基准会遗漏更智能任务分配带来的收益,而这在真实服务系统中可能成为决定性因素。

吞吐量数字掩盖了内存共享与碎片化的真实表现

分页注意力(Paged Attention)的主要卖点在于KV缓存内存近乎零浪费,以及请求内部和请求之间KV缓存的灵活共享,相比FasterTransformer和Orca等系统,吞吐量可提升2至4倍[2]。但这种优势并非均匀分布——在更长的序列、更大的模型和更复杂的解码算法下,效果更为显著[2]。如果只用短序列或简单解码做一次吞吐量测试,你无法看出分页注意力如何应对长上下文请求带来的内存压力。同样,2025年一项针对vLLM(采用分页注意力)的评估发现,它显著改善了聊天机器人推理的响应时间,但效果会随最小生成令牌数和所用模型的不同而变化[4]。因此,单一的吞吐量数字无法告诉你分页注意力是否真的适合你的具体工作负载——你需要用自己的序列长度和请求模式进行测试。

关于这些来源

这个回答基于4项研究(3项经同行评审,1项为预印本),发表于2024年至2026年间,其中4项均为2024年或之后发表。这些研究是从4项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的34篇文献。

本文引用的文献

1

受RTT限制还是带宽限制?揭秘大语言模型服务中的KV缓存传输

在地理分布式大语言模型服务中,KV缓存传输主要受往返时延(RTT)限制,而非带宽限制;非连续的分页注意力内存块按顺序传输时,在高RTT条件下会导致有效吞吐量急剧下降,这与TCP小发送窗口问题类似。

2

面向大语言模型(LLMs)服务的高效内存缩减管理:基于Paged Attention的KV缓存共享的Open-AI模型

PagedAttention实现了近乎为零的KV缓存内存浪费和灵活的共享,相较于FasterTransformer和Orca,吞吐量提升了2–4倍,且在更长序列、更大模型和更复杂的解码算法下,性能提升更为显著。

3

PersistentKV:面向商品GPU上长上下文LLM服务的页感知解码调度

在RTX 3060上进行的一项页面感知解码调度研究发现,一种在FlashInfer、序列拆分和工作队列调度之间进行自适应选择的策略,在B8双峰/均匀/类Zipf工作负载上将同步墙钟吞吐量提升了1.063–1.265倍,在B1分桶轨迹上提升了1.399倍,同时避免了B4边界情况下的性能回退。

4

使用vLLM加速聊天机器人推理:评估PagedAttention的效率

对vLLM与PagedAttention在Gemma、HuggingFaceTB和Llama模型上的评估发现,该方法显著提升了聊天机器人推理的响应时间,但效果因模型和最小令牌生成设置的不同而有所差异。