哪些产品设计选择能让长上下文服务中的块稀疏预填充更可控?

使块稀疏预填充可控的设计选择:自适应预算、不确定性门控和上下文感知模式,均得到近期研究的支持。

直接答案

为了让块稀疏预填充变得可控,设计时应采用自适应的、按查询分配预算的方式,而非固定稀疏度。近期研究表明,让模型根据不确定性或上下文自行决定保留多少块,既能保持准确性,又能大幅缩短预填充时间。例如,在32K上下文长度的“大海捞针”任务中,一种基于不确定性门控的路由器将召回率从0.51提升至0.63;而一种上下文感知方法在128K长度下实现了4.95倍加速,同时保留了全注意力准确率的98.35%。这些设计为你提供了一个调节旋钮:用少量计算换取对准确性的高度控制。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么固定稀疏预算让人感觉难以控制——以及该怎么做

早期的块稀疏注意力方法采用固定的top-k选择:每个查询保留相同数量的键块,无论分数之间有多接近。这让人感觉缺乏可控性,因为一个top-k截断处差距极小的查询,可能会丢掉那个恰好包含答案的块。2026年的一项研究[2]表明,这是一个真实的失败模式:当第k个和第(k+1)个块几乎不相上下时,选择器会在不额外花费预算的情况下做出决定,而被丢弃的块则无法挽回。解决办法是让预算变得自适应——测量最后保留的块与第一个被拒绝的块之间的分数差距,对于差距较小的查询,将保留的集合加倍。这种“信息价值”路由器在14B模型的32K上下文长度下,将针尖寻物任务中的配对召回率从0.51提升到0.63;而在7B模型上,面对1M上下文时,它在32K长度下达到1.00,在128K长度下达到0.81,相比之下固定top-k仅为0.09。启示在于:可控性来自让模型在不确定时投入更多计算,而非来自僵化的上限。

让输入决定模式,而非一刀切的掩码

另一个杠杆是让稀疏模式本身适应输入,而不是使用固定的结构掩码。FlexPrefill [3] 通过测量查询的注意力分布与预定义模式之间的 Jensen-Shannon 散度来实现这一点;如果两者出现分歧,它就会切换到查询特定的模式。它还使用累积注意力阈值来选择索引,确保注意力分数的总和达到预定义阈值。这种按头和按提示进行的动态调整,正是让系统感觉可控的原因——你不需要猜测哪些块重要;模型会告诉你。类似地,VSPrefill [4] 使用轻量级索引器来预测垂直列和斜对角线的重要性分数,然后通过自适应累积阈值策略为每层分配稀疏预算。它在 128K 上下文下保持了全注意力准确率的 98.35%,同时实现了 4.95 倍的平均加速。这两种方法都表明,上下文感知模式能带来可预测的准确率-效率权衡,而这正是可控性的本质。

别扔掉长尾——压缩它

第三种设计选择是彻底避免硬性截断,而是将未选中的块压缩成紧凑状态,而非直接丢弃。SPLA [5] 通过残差线性注意力模块实现了这一点:它计算全局注意力与所选线性注意力之间的差异,因此未选中的块从未被显式访问,但其信息仍被保留。这缩小了持续预训练中的性能差距,甚至在RULER等长上下文基准上超越了密集注意力。这里的可控性在于,你无需担心“答案跳的唯一载体”会丢失——长尾信息仍被表示,只是成本更低。这是一种不同层面的控制:你并非在调整预算,而是在改变表示方式,使稀疏性带来的损失不再那么严重。

关于这些来源

本回答基于5项研究(2项经同行评审,3项为预印本),发表于2024年至2026年间,其中5项为2024年或之后发表。这些研究是从6项通过质量筛选的研究中选出的最相关者,而这6项研究又源自从超过5亿篇论文的数据库中检索到的27篇文献。

本文引用的文献

1

用于高效预填充的块注意力机制

Block-attention将文档划分为多个块,除最后一个块外,各块独立计算KV状态。经过微调后,对于32K输入,其TTFT(首令牌生成时间)为45毫秒,相比全注意力机制,TTFT降低了98.7%,FLOPs降低了99.8%,同时保持了相当的性能水平。

2

用于块稀疏注意力的不确定性门控选择

一种不确定性门控路由器,在top-k截断不确定时将保留集合加倍,使RULER NIAH-multikey上的配对召回率在14B模型的32K长度下从0.51提升至0.63(均值)和从0.93提升至0.98(Quest),并在7B-1M模型的32K长度下达到1.00;预算匹配消融实验表明,约三分之二的提升归因于均匀预算效应,三分之一归因于选择性。

3

FlexPrefill:一种面向高效长序列推理的上下文感知稀疏注意力机制

FlexPrefill通过詹森-香农散度和基于累积注意力的索引选择,动态调整每个头的稀疏模式和预算,在长序列推理中相比先前方法提升了速度和准确性。

4

VSPrefill:面向长上下文预填充的垂直斜线稀疏注意力与轻量级索引

VSPrefill使用轻量级VSIndexer预测垂直列和斜对角线的注意力重要性分数,并采用自适应累积阈值策略,在128K上下文长度下保留了98.35%的全注意力精度,同时实现了4.95倍的平均加速。

5

SPLA:面向长上下文建模的块稀疏加线性注意力

SPLA采用二阶泰勒展开选择度量和残差线性注意力模块来压缩未选中的块,在RULER上超越了密集注意力,同时保持了具有竞争力的通用知识与推理能力。