对于区块扩散投机解码,哪些部署指标比生成延迟测试更重要?

除了原始延迟之外,吞吐量、接受率、草稿容量以及测试时扩展对于区块扩散投机解码的部署更为重要。

直接答案

对于块扩散推测解码而言,原始生成延迟测试无法反映真正决定实际加速效果的因素:草稿令牌的接受率、草稿模型提出优质块的能力,以及系统在负载下的扩展表现。DFlash的6倍加速源于高接受率,而非仅仅依赖快速起草[3];而DFlare在Qwen3-4B上实现的5.52倍加速则表明,更深层的草稿模型配合更丰富的目标层融合,能进一步提升接受率[1]。在驾驶视觉-语言-动作模型(VLA)中,吞吐量(较自回归方法提升12倍)以及通过共享前缀展开实现的测试时扩展,比单块延迟更为关键[2]。纵观这些研究,一个贯穿始终的主题是:部署指标应衡量端到端吞吐量和接受质量,而非仅仅关注首令牌时间。

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何接受率优于原始延迟,是区块扩散解码的关键

投机解码的核心在于,目标模型会并行验证一批草稿令牌。如果草稿令牌有误,目标模型会将其拒绝,而这次并行验证也就白费了。因此,真正决定加速效果的关键指标是接受率——即目标模型接受的草稿令牌所占的比例。DFlash宣称实现了超过6倍的无损加速,其关键在于它的块扩散草稿模型能生成高质量输出,从而被目标模型接受,而并非草稿模型本身单独运行有多快[3]。如果延迟测试只衡量草稿模型的生成时间,就会完全忽略这一点。

DFlare进一步推进了这一方向,表明草稿容量——即草稿模型的表达能力——直接提升了接受率。通过为每个草稿层赋予其自身可学习的目标层组合(而非单一的融合表示),DFlare将草稿模型扩展得更深,并在Qwen3-4B上实现了平均5.52倍的墙钟加速,在Qwen3-8B上实现5.46倍,在GPT-OSS-20B上实现3.91倍,相较于DFlash分别提升了11%、8%和5%[1]。这些百分比增益正是纯延迟基准测试所无法体现的改进,因为它们源于更好的草稿质量,而非更快的生成速度。

吞吐量与测试时扩展:真正决定实际部署的关键指标

在生产环境中,你关心的不仅是单个请求完成得有多快,更是每秒能处理多少个请求。Fast-dDrive——一款面向自动驾驶的块扩散视觉-语言-动作模型——在与SGLang集成后,报告称其吞吐量相比自回归基线提升了12倍[2]。这是一个部署层面的指标,涵盖了批处理、内存带宽和并行验证等因素——而这些是单块延迟测试所忽略的。对于边缘硬件而言,受内存带宽限制的自回归模型是瓶颈所在,而块扩散的并行草拟机制则直接针对这一问题[2]

测试时扩展是另一个比延迟更重要的部署指标。Fast-dDrive引入了一种低开销方案:从共享前缀的KV缓存中分叉出N条随机轨迹展开,并对它们取平均,以极低的成本抑制预测方差[2]。这是一种在不牺牲吞吐量的情况下提升输出质量的方法——这种权衡是延迟测试无法体现的。同样,DDTree根据草稿模型在每个位置的分布构建一棵草稿树,在固定的节点预算下选择最可能的续写内容,并在一次目标前向传播中验证整棵树[4]。这里关键的指标是每次验证通过时的期望接受长度,而不是生成单个块所需的时间。

草拟能力与架构:加速数字背后的隐藏变量

块扩散推测解码带来的加速效果,很大程度上取决于草稿模型的架构,以及它如何以目标模型为条件进行生成。DFlash 将草稿模型建立在目标模型的上下文特征之上,这正是其能够实现高接受率的关键 [3]。DFlare 则指出了 DFlash 中的一个瓶颈:所有草稿层共享一个仅由少数目标层融合而成的单一表示,这限制了各层自身的表达能力。通过引入轻量级的逐层融合机制来打破这一瓶颈,DFlare 让每一层草稿层都能关注各自对应的目标层组合,从而支持更深的草稿模型,并带来持续的性能提升 [1]。因此,在评估部署方案时,你应该衡量草稿模型的能力如何随深度扩展——这一指标是简单的延迟测试无法揭示的。

训练数据的规模同样至关重要。DFlare将训练数据从80万样本扩展到240万,以充分利用扩大的草稿模型容量[1]。这是一个部署层面的考量:在更多数据上训练的草稿模型可能具有更高的接受率,但训练成本也更高。延迟测试无法告诉你草稿模型是否针对任务训练不足。相比之下,Fast-dDrive采用了一种面向区段感知的训练方案,优先考虑安全关键的规划,这是一种领域特定的调整,对输出质量的影响大于原始速度[2]。对于自动驾驶而言,真正重要的指标是平均位移误差(ADE)——Fast-dDrive在WOD-E2E上达到了SOTA的ADE@3s和ADE@5s,并将nuScenes上的L2误差降至0.32米,提升了22%[2]。这些是延迟测试完全忽略的质量指标。

关于这些资料来源

此回答基于4项研究(均为预印本)——发表于2026年,其中4项为2024年或之后——从4项通过质量筛选的研究中选出最相关的,这些研究来自从超过5亿篇论文数据库中检索到的26篇文献。

本文引用的文献

1

DFlare:扩展块扩散投机解码的草稿容量

DFlare在Qwen3-4B、Qwen3-8B和GPT-OSS-20B上分别比DFlash提升了11%、8%和5%,实现了平均5.52倍、5.46倍和3.91倍的端到端加速。这得益于其轻量级的逐层融合机制——每个草稿层都拥有自己对应的目标层组合——以及将训练数据从80万条扩展到240万条。

2

Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型

Fast-dDrive是一种用于自动驾驶的块扩散VLA模型,在WOD-E2E上取得了SOTA级别的ADE@3s和ADE@5s成绩,并将nuScenes上的L2误差降至0.32米(提升22%)。同时,在与SGLang集成时,其吞吐速度相比自回归基线提升了12倍。这得益于其采用的分段感知训练方案,以及一种低开销的测试时扩展机制——该机制从共享前缀的KV缓存中分叉出N条随机 rollout,从而显著提升效率。

3

DFlash:用于闪速推测解码的块扩散方法

DFlash是一种基于块扩散推测解码的框架,能够在前向传播中一次性生成草稿令牌,并让草稿模型基于目标模型的上下文特征进行条件生成,在多种模型和任务上实现了超过6倍的无损加速,其加速效果比EAGLE-3最高提升2.5倍。

4

使用块扩散草稿树加速推测解码

DDTree利用块扩散草稿模型的逐位置分布,通过最佳优先堆算法在固定节点预算下选择最可能的续写内容,构建出一棵草稿树,并借助仅含祖先节点的注意力掩码,在单次目标前向传播中验证整棵树,基于DFlash进一步提升了接受长度。