在受控演示之外,区块扩散投机解码要真正落地,还需解决哪些问题?

分块扩散投机解码需要成本感知的树预算、自适应块大小,以及对随机采样的处理,才能超越演示场景真正投入使用。

直接答案

块扩散推测解码——即轻量模型并行起草一整块令牌,供更大模型验证——在受控演示之外可靠运行前,仍需解决三个问题:为每个输入选择合适的树大小和形状、适应目标模型的随机性,以及考虑实际硬件成本。近期研究表明,固定预算和块大小并非最优:例如,一种逐轮自适应调整树预算的方法,其表现可与预先知晓最佳预算的预言机相媲美甚至更优[1];另一种按输入预测块大小的方法,在Qwen3-4B上实现了4.20倍的加速[3]。综合这些研究,最有力的证据指向动态且成本感知的决策,这才是将前景可观的演示转化为实际加速的关键。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

已被推翻的认知:固定预算与固定块大小并非最优

过去的假设是,你可以选定一个单一的树大小或块大小,它就能对所有输入都表现良好。如今已知这种想法是错误的。[1]表明接受长度总是随树预算增加而增长,因此不存在一种有原则的方法来选择固定预算——你总会想要最大的树,但这忽略了验证成本。[3]表明最优块大小因样本而异,并围绕训练规模聚集,因此一刀切的方法会浪费速度。综合来看,这两篇论文推翻了静态配置就足够好的观点。

待解决的问题:成本感知的树构建、自适应块大小与随机性处理

首先,你需要以实际吞吐量为目标来构建草稿树,而不仅仅是关注接受长度。[1]提出了一种方法,联合选择树结构和节点预算,对草稿生成和验证延迟进行建模,并证明吞吐量函数是单峰的,从而支持高效的贪心停止规则。这意味着你可以在每轮中自适应调整预算,无需离线搜索,其效果能匹配甚至超越一个预先知道最优预算的“神谕”模型。

其次,你需要根据输入调整块大小。[3]表明,根据预填充表示——即生成前处理的那部分输入——来预测最优块大小,可以在Qwen3-4B上实现4.20倍的加速,接受长度为5.92个token。这是一项即插即用的改进,额外开销极小。

第三,你需要处理目标模型的随机性。[4]表明,假设条件独立性的块扩散草稿模型在目标采样分布变得更加随机(熵更高)时会性能下降。他们提出了一种具有面向接受度的训练目标的依赖块草稿模型,该模型能提高接受长度,尤其是在高熵场景下。这一点至关重要,因为实际部署中通常使用采样,而非贪心解码。

新图景:动态、成本感知与随机性感知的草稿生成

目前的共识是,块扩散投机解码必须具有动态性和成本感知能力。[5]结合了接受度代理、在线延迟估计器和自适应最佳优先扩展,以扩展树结构,直到边际收益不再足以抵消验证成本。该方法相较于自回归解码实现了最高6.61倍的加速,并比最先进的基线方法提升了39%,且无需针对具体设置进行调优。这表明,无需训练且具备预算感知能力的方法既能高效又具有实用性。

另一个角度是利用多个草稿模型来从早期不匹配中恢复。[2]提出了一种双扩散框架,利用置信度分数识别可能的拒绝边界,并重新锚定替代续写,从而相比单序列草稿提高了接受率。这解决了单一草稿序列在首次不匹配后浪费所有后续token的问题。

关键要点在于,该领域正从静态、贪婪、不考虑成本的草拟方式,转向自适应、成本感知且考虑随机性的方法。这些论文一致认为,动态决策——无论是关于树预算、块大小,还是处理随机性——对于实现实际场景中的加速至关重要。最有力的证据来自[1][3],它们展示了自适应带来的具体收益,而[4][5]则强调了处理随机性和硬件成本的重要性。

关于这些来源

本回答基于5项同行评审研究——其中1项发表于2026年,5项发表于2024年或之后——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的30篇文献。

本文引用的文献

1

用于投机解码的成本感知扩散草稿树

CaDDTree通过联合选择树结构和节点预算来优化令牌吞吐量,证明了在凸验证成本下吞吐量函数具有单峰性,并在Qwen3-4B/8B的八个基准测试中达到或超越了预言机预算选择的效果。

2

D^2SD:利用双扩散草稿模型加速推测解码

D²SD使用两个扩散草稿器——一个用于生成带有置信度分数的块,另一个用于在可能的拒绝边界处重新锚定——从而比单序列草稿生成获得更高的接受率。

3

BlockPilot:基于扩散的投机解码的实例自适应策略学习

BlockPilot根据预填充表示预测每个输入的最优块大小,在Qwen3-4B上、温度为1的条件下实现了4.20倍的加速和5.92的接受长度,且开销极低。

4

DBLAST:面向随机投机解码的依赖块草拟方法

DBLast表明,区块扩散起草者会随着目标采样熵的增加而性能下降,并提出了一种具有面向接受目标的依赖区块起草者,该设计在提升接受长度方面表现优异,尤其是在高熵场景下。

5

Bastion:基于树结构块扩散草拟的预算感知投机解码

BASTION是一个无需训练、预算感知的框架,它动态扩展树结构,直到边际收益不再足以抵消验证成本,从而在多种基准测试和GPU架构上实现高达6.61倍的加速,并比最先进的基线方法平均提升39%的性能。