硬件预算的边界在哪里?
最具体的安全边界是你的硬件预算:只有当接受token的边际收益超过新增验证成本时,才应扩展草稿树或块大小。BASTION [2] 通过在线延迟估计器和最佳优先扩展将这一原则形式化,当边际收益不再足以抵消增量验证成本时停止扩展,相比自回归解码实现了最高6.61倍的加速,并比其他块扩散基线方法提升了39%。这意味着边界并非固定的草稿token数量,而是一个取决于你GPU延迟特征的动态截止点。
类似地,D^2SD [1] 也提醒道,盲目地批量增加草稿候选序列只会带来边际改进,因为冗余分支会推高草稿生成与验证成本,却无法成比例地增加被接受的token数量。相反,它利用置信度分数,仅挑选最可能的拒绝边界和Top-K前缀范围,从而将树结构控制在实用预算之内。因此,安全线在于:只在置信度高且硬件能承受成本的地方进行扩展。
随机采样何时会将边界向内推?
第二个边界是目标模型采样分布的熵。DBLAST [4] 表明,假设各位置条件独立的块扩散草稿模型,其接受的草稿长度会随着目标采样分布熵的增加而下降——这意味着在创意性或高温度设定下,安全区域会缩小。DBLAST 通过引入依赖块草稿模型和面向接受率的训练目标来解决这一问题,在独立块采样的基础上持续提升接受长度,尤其是在高熵场景中表现更为显著。
这是一个关键的分界线,因为许多实际应用都使用随机解码(例如,温度参数大于0)。证据表明,如果你在高熵环境中使用块扩散草稿模型,你需要要么切换到像DBLAST这样的依赖型草稿模型,要么接受较低的接受率。这条分界线不仅仅关乎硬件——它关乎草稿模型的假设与目标行为之间的统计匹配度。
为什么固定块大小会带来安全风险?
第三个边界是块大小:对所有输入使用固定的块大小并非最优,可能会将你推出安全区。BlockPilot [5] 表明,最优块大小因样本而异,并集中在训练时的块大小附近,因此一刀切的方法会浪费加速效果。通过从预填充表示中预测最优块大小,BlockPilot 在 Qwen3-4B 上、温度为 T=1 时实现了 5.92 的接受长度和 4.20 倍的加速,持续优于固定大小方法的效率。
这意味着安全边界并非一个固定数值,而是针对每个实例单独做出的决策。BlockPilot 的证据表明,你应根据输入的难度和目标模型的行为来调整块大小,而不是假设存在一种统一的最优策略。这是一个实用的边界,从业者可以以极低的额外开销加以实施。
关于这些来源
该回答基于5项研究(均为预印本)——发表于2026年,其中5项为2024年或之后——从7项通过质量筛选的研究中选出最具相关性的,这些研究来自从超过5亿篇论文数据库中检索到的26篇文献。
本文引用的文献
D^2SD:利用双扩散草稿模型加速推测解码
D^2SD提出了一种双扩散草稿框架,将候选结果组织成置信度引导的前缀树,利用置信度分数选择前K个前缀范围进行恢复,并在底层扩散方法和自回归基线方法上均展现出显著改进。
Bastion:基于树结构块扩散草拟的预算感知投机解码
BASTION 提出了一种预算感知的树状结构块扩散草拟框架,通过接受度代理模型和在线延迟估计器动态构建依赖查询的树结构,相较于自回归解码实现了最高 6.61 倍的加速,并比最先进的块扩散基线方法提升了 39% 的性能。
使用块扩散草稿树加速推测解码
DDTree利用块扩散起草器在每个位置上的分布,通过最佳优先堆算法在固定节点预算下构建一棵草稿树,并在单次目标前向传播中对其进行验证,从而跻身领先的推测解码方法之列。
DBLAST:面向随机投机解码的依赖块草拟方法
DBLAST表明,对于区块扩散起草器而言,接受的草稿长度会随着目标采样熵的增加而下降,并提出了一种依赖区块起草器,采用面向接受度的训练目标,能够持续提升接受长度,尤其在较高熵区域效果更为显著。
BlockPilot:基于扩散的推测解码的实例自适应策略学习
BlockPilot表明,最优块大小因样本而异,并集中在训练块大小附近,同时提出了一种实例自适应策略,该策略从预填充表示中预测最优块大小,在Qwen3-4B上、T=1时实现了5.92的接受长度和4.20倍的加速。
