你的瓶颈是算力还是内存搬运?
在长上下文场景下,瓶颈往往从矩阵乘法转移到键值(KV)缓存数据的搬运上。2026年一项针对商用GPU的研究发现,自回归解码越来越受限于KV缓存的移动,而非密集计算[1]。因此,你的监控应关注内存带宽利用率、PCIe流量和缓存命中率,而不仅仅是GPU计算利用率。
例如,PersistentKV的研究表明,低活跃度的长上下文解码可能无法充分利用商用GPU,这意味着即使系统运行缓慢,你也可能看到较低的GPU利用率[1]。如果你的监控只关注计算量,就会错过真正的问题。要留意高内存流量伴随低FLOPs的情况——这正是内存受限解码的典型特征。
为何“一刀切”式调度在混合负载下失效
在峰值负载下,你会同时遇到短序列和长序列,而针对某一批次最优的核函数,对另一批次可能效果极差。2026年的一项研究发现,最佳的单核函数实现并不总是最优的服务调度方案[1]。他们证明,一种自适应策略——在小批次时使用稠密核函数,在长上下文步骤时切换为稀疏工作队列——在双峰、均匀和类Zipf分布的工作负载下,吞吐量提升了1.063–1.265倍,在分桶轨迹上则提升了1.399倍[1]。
监控方面的经验是:跟踪序列长度和活跃KV头组的分布。如果看到大量小而活跃的批次,就使用密集内核;如果看到长上下文步骤中活跃头很少,则切换到稀疏调度。同一项研究指出,在一个边界案例中,自适应策略通过选择密集内核避免了性能回退[1]——因此你的监控应基于批次组成来触发内核切换。
当KV缓存溢出到CPU时,需监控PCIe瓶颈
对于极长的上下文,KV缓存可能无法完全容纳在GPU内存中,因此需要将其溢出到CPU。这引入了新的瓶颈:跨GPU-CPU边界检索细粒度、不规则的KV子集,可能会抵消稀疏性带来的优势[2]。2026年推出的名为SPIN的框架通过一种局部性感知的缓存管理器解决了这一问题,该管理器动态调整每个请求的HBM预算,并采用分桶LRU策略以减少PCIe往返次数[2]。
在实践中,这意味着你应在页面级别监控PCIe传输速率和缓存命中率。与vLLM相比,SPIN实现了1.66–5.66倍的端到端吞吐量提升,首令牌时间(TTFT)降低了7–9倍,并将每输出令牌时间(TPOT)最多减少了58%[2]。如果你的监控显示PCIe流量较高,可考虑调整HBM预算或采用更具局部性感知的淘汰策略。
切勿忽视预填充与量化对分页注意力机制的影响
峰值负载包括预填充阶段,该阶段计算密集,对于长上下文可能成为瓶颈。2026年的一项研究FlashPrefill V2表明,在FP8精度下、128K上下文长度时,块稀疏预填充注意力相比FlashAttention-2可将预填充速度提升高达47.26倍[5]。这表明单独监控预填充时间至关重要——如果预填充占主导,您可能需要采用稀疏注意力后端。
KV 缓存的量化同样可以降低内存压力并提升吞吐量。2025年一项关于vLLM的研究发现,在并发多请求场景下,对KV缓存进行分组量化可将推理吞吐量提升最高18%,同时保持较低的精度损失[3]。因此,建议监控内存使用情况,若遇到内存瓶颈可考虑量化方案,但也要留意精度下降的风险。
关于这些来源
这个回答基于5项研究(1篇同行评审,4篇预印本)——发表于2025年至2026年,其中5篇为2024年或之后——从6项通过质量筛选的研究中选出最相关的,这些研究来自从超过5亿篇论文数据库中检索到的39篇文献。
本文引用的文献
PersistentKV:面向商品GPU上长上下文LLM服务的页感知解码调度
PersistentKV表明,在RTX 3060上,与单一最优内核相比,自适应页面感知解码调度(在密集与稀疏内核之间切换)在双峰/均匀/Zipf工作负载下将吞吐量提升了1.063–1.265倍,在分桶追踪下提升了1.399倍。
将稀疏注意力与分层记忆统一,以实现可扩展的长上下文大语言模型服务
SPIN是一种采用分层KV存储的稀疏注意力框架,通过局部性感知缓存管理器和分桶LRU策略,其端到端吞吐量比vLLM高出1.66–5.66倍,TTFT降低7–9倍,TPOT最多减少58%。
基于vLLM推理引擎的KV缓存组量化
vLLM中的KV缓存分组量化在并发多请求场景下将推理吞吐量提升了最高18%,同时保持了较低的精度损失,该测试在LLaMA2-7B、LLaMA3-8B和DeepSeek-R1-Distill-LLaMA3-8B上完成。
面向资源高效的LLM推理服务,进行机器学习与系统的协同设计
一篇关于面向大语言模型服务的机器学习与系统协同设计的论文,分析了思维骨架提示、提示压缩和KV缓存量化等优化在准确性与性能之间的权衡,并在vLLM上实现了系统组件,但完整集成仍在进行中。
FlashPrefill V2:面向长上下文LLM服务的块稀疏预填充注意力
FlashPrefill V2是一款块稀疏预填充注意力内核,在128K上下文长度下,FP8和BF16精度分别实现了相比FlashAttention-2最高47.26倍和27.19倍的加速,并支持分页KV缓存和连续批处理。
