针对长上下文服务,块稀疏预填充自然引出了哪些研究问题?

块稀疏预填充大幅降低了长上下文延迟,但在准确性、泛化能力以及服务系统集成方面仍存在待解问题。

直接答案

块稀疏预填充可将32K token输入下的首token延迟降低超过98%,并将注意力FLOPs减少99.8%[1],但这些收益伴随权衡:当仅关注不到2%的token时,准确率可能降至全注意力的95%[4],且最佳稀疏模式因任务和模型而异[2][6]。研究指向几个自然的后续问题:如何在不进行大量微调的情况下使稀疏选择具备自适应性和准确性,如何结合稀疏注意力与线性注意力以避免丢失上下文中的“长尾”部分[3],以及如何将这些方法集成到处理动态负载和内存约束的 serving 系统中[7][8][9]

9篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

在加速预填充时,你能保持多少准确率?

头条数字颇为惊人:Block-attention声称在32K token输入下,首token延迟降低98.7%,FLOPs减少99.8%,同时微调后性能与全注意力相当[1]。但这是最理想的情况——该方法需要对模型进行微调以适应分块注意力,且仅在上下文自然分段(如检索到的文档)时效果最佳。

其他方法则致力于免训练或轻量训练下的稀疏化。VSPrefill利用轻量级索引器预测重要列和对角线,在LongBench和RULER上保持了全注意力98.35%的准确率,同时在128K上下文下实现了平均4.95倍的加速[2]。TokenSelect作为一种免训练方法,报告称注意力计算速度最高提升23.84倍,端到端延迟降低2.28倍,但其摘要中并未将准确率与全注意力进行直接对比[5]

核心矛盾在于:稀疏化越激进,精度损失的风险就越大。SparseServe将未被选中的KV缓存卸载到DRAM,其结果表明,即便采用动态稀疏注意力,也能实现高达9.26倍的TTFT降低和3.14倍的吞吐量提升,但该研究未报告精度数据——这暗示精度与效率之间的权衡边界仍在探索之中[8]

你未关注的上下文会怎样?

一个自然的问题是,丢弃未选中的块是否会丢失重要信息。SPLA通过残差线性注意力模块将未选中的块压缩为紧凑的循环状态,而非直接丢弃,从而直接解决了这一问题[3]。这种方法不仅弥合了与密集注意力之间的性能差距,还在RULER上实现了超越,表明上下文的“长尾”部分比以往认为的更为重要。

这与TokenSelect等方法形成对比,后者依赖top-k选择并丢弃其余部分[5]。问题随之而来:何时可以安全地丢弃,何时又需要后备方案?SPLA的成功表明,一种混合策略——对最相关的块采用稀疏处理,对其余部分采用线性处理——或许是最稳健的前进方向。

另一个角度是模式共享。稀疏模式共享[6]利用了这样一个观察:注意力模式在不同头和不同输入之间具有相似性,因此只需对一小部分头计算完整的注意力,并共享这些模式。这降低了精确选择的成本,但也引出一个问题:这些模式在不同任务和领域之间有多稳定?论文展示了在多样化输入下的一致性,但那是在基准测试上——实际部署中的情况可能更加多样。

这些方法在真实服务负载下表现如何?

大多数稀疏注意力研究都聚焦于单次推理调用,但实际服务系统需要处理大量并发请求,且这些请求的预填充和解码阶段各不相同。P-PAS表明,最优的令牌调度预算会随负载变化:在低压力下,较大的预算更有帮助;而在高压力下,较小的预算能减少与解码过程的相互干扰[7]。这意味着,单独运行效果良好的稀疏预填充方法,若缺乏自适应调度,未必能直接应用于服务系统。

内存是另一个瓶颈。SparseServe和LongSight都致力于解决KV缓存大小的问题:SparseServe将未选中的KV缓存卸载到DRAM,以释放HBM空间,从而支持更大的批处理规模[8];而LongSight则利用支持计算功能的CXL内存来存储KV缓存,在单个GPU上即可支持多达100万token的处理[9]。这些是系统层面的解决方案,与算法层面的稀疏性相辅相成,但它们也带来了关于缓存管理、数据传输开销以及硬件需求的新问题。

这里的研究问题是:如何将稀疏注意力算法与服务系统协同设计,以在真实工作负载下最大化吞吐量并最小化延迟?这些论文表明,答案不仅仅在于算法本身——还涉及调度、内存层次结构和硬件加速。

关于这些来源

本回答基于9项研究(4项经同行评审,5项为预印本),发表于2024年至2026年间,其中9项为2024年或之后发表。这些研究是从9项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的24篇文献。

本文引用的文献

1

用于高效预填充的块注意力机制

块注意力机制将上下文划分为多个块并复用KV状态,在32K token输入下将首Token延迟(TTFT)降低98.7%,计算量(FLOPs)降低99.8%,同时经过微调后在11项基准测试中保持了与全注意力相当的性能。

2

VSPrefill:面向长上下文预填充的垂直斜线稀疏注意力与轻量级索引

VSPrefill通过轻量级索引器预测重要的垂直列和斜对角线,在LongBench和RULER上保留了全注意力准确率的98.35%,同时在128K上下文下实现了平均4.95倍的加速,且无需修改骨干网络参数。

3

SPLA:面向长上下文建模的块稀疏加线性注意力

SPLA将块稀疏注意力与残差线性注意力模块相结合,以压缩未选中的块,在持续预训练中于RULER基准上超越了密集注意力,同时保持了具有竞争力的通用知识水平。

4

利用稀疏性实现长上下文推理:在商用GPU上处理百万级Token上下文

一种仅关注不到2%输入令牌的top-k选择机制,在RULER、AlpacaEval和Open LLM排行榜上实现了超过95%的模型性能,使得在约16GB内存的商用GPU上能够进行100万令牌的推理。

5

TokenSelect:通过动态Token级KV缓存选择实现大语言模型的高效长上下文推理与长度外推

TokenSelect是一种无需训练的方法,通过每头软投票来筛选关键KV缓存令牌,在注意力计算中实现了高达23.84倍的加速,端到端延迟降低2.28倍,其性能优于当前最先进的长上下文推理方法。

6

通过稀疏模式共享加速长上下文大语言模型的预填充

稀疏模式共享利用注意力模式中头间的相似性,仅对一小部分头计算完整注意力,在实现与最先进方法相当或更优加速效果的同时,提供了最佳的整体准确率。

7

P-PAS:面向长上下文LLM服务的预填充压力自适应调度

P-PAS表明,vLLM中的最优令牌调度预算取决于负载压力;动态调整能够在负载变化时保持较低的端到端延迟,而较大的预填充块仅在调度压力较低时才能提升效率。

8

SparseServe:解锁长上下文大语言模型服务中动态稀疏注意力的并行性

SparseServe是一个面向动态稀疏注意力的服务系统,通过分层HBM-DRAM管理,与最先进的系统相比,平均TTFT降低高达9.26倍,令牌生成吞吐量提升3.14倍。

9

LongSight:通过稀疏注意力加速大上下文大语言模型的计算增强型内存

LongSight是一种利用支持计算的CXL内存进行算法与硬件协同设计的方案,可在单个GPU上为Llama模型支持高达100万token的上下文,有效将LPDDR DRAM的性能提升至接近HBM的水平。