为何接受率优于原始延迟,是区块扩散解码的关键
投机解码的核心在于,目标模型会并行验证一批草稿令牌。如果草稿令牌有误,目标模型会将其拒绝,而这次并行验证也就白费了。因此,真正决定加速效果的关键指标是接受率——即目标模型接受的草稿令牌所占的比例。DFlash宣称实现了超过6倍的无损加速,其关键在于它的块扩散草稿模型能生成高质量输出,从而被目标模型接受,而并非草稿模型本身单独运行有多快[3]。如果延迟测试只衡量草稿模型的生成时间,就会完全忽略这一点。
DFlare进一步推进了这一方向,表明草稿容量——即草稿模型的表达能力——直接提升了接受率。通过为每个草稿层赋予其自身可学习的目标层组合(而非单一的融合表示),DFlare将草稿模型扩展得更深,并在Qwen3-4B上实现了平均5.52倍的墙钟加速,在Qwen3-8B上实现5.46倍,在GPT-OSS-20B上实现3.91倍,相较于DFlash分别提升了11%、8%和5%[1]。这些百分比增益正是纯延迟基准测试所无法体现的改进,因为它们源于更好的草稿质量,而非更快的生成速度。
吞吐量与测试时扩展:真正决定实际部署的关键指标
在生产环境中,你关心的不仅是单个请求完成得有多快,更是每秒能处理多少个请求。Fast-dDrive——一款面向自动驾驶的块扩散视觉-语言-动作模型——在与SGLang集成后,报告称其吞吐量相比自回归基线提升了12倍[2]。这是一个部署层面的指标,涵盖了批处理、内存带宽和并行验证等因素——而这些是单块延迟测试所忽略的。对于边缘硬件而言,受内存带宽限制的自回归模型是瓶颈所在,而块扩散的并行草拟机制则直接针对这一问题[2]。
测试时扩展是另一个比延迟更重要的部署指标。Fast-dDrive引入了一种低开销方案:从共享前缀的KV缓存中分叉出N条随机轨迹展开,并对它们取平均,以极低的成本抑制预测方差[2]。这是一种在不牺牲吞吐量的情况下提升输出质量的方法——这种权衡是延迟测试无法体现的。同样,DDTree根据草稿模型在每个位置的分布构建一棵草稿树,在固定的节点预算下选择最可能的续写内容,并在一次目标前向传播中验证整棵树[4]。这里关键的指标是每次验证通过时的期望接受长度,而不是生成单个块所需的时间。
关于这些资料来源
此回答基于4项研究(均为预印本)——发表于2026年,其中4项为2024年或之后——从4项通过质量筛选的研究中选出最相关的,这些研究来自从超过5亿篇论文数据库中检索到的26篇文献。
本文引用的文献
DFlare:扩展块扩散投机解码的草稿容量
DFlare在Qwen3-4B、Qwen3-8B和GPT-OSS-20B上分别比DFlash提升了11%、8%和5%,实现了平均5.52倍、5.46倍和3.91倍的端到端加速。这得益于其轻量级的逐层融合机制——每个草稿层都拥有自己对应的目标层组合——以及将训练数据从80万条扩展到240万条。
Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型
Fast-dDrive是一种用于自动驾驶的块扩散VLA模型,在WOD-E2E上取得了SOTA级别的ADE@3s和ADE@5s成绩,并将nuScenes上的L2误差降至0.32米(提升22%)。同时,在与SGLang集成时,其吞吐速度相比自回归基线提升了12倍。这得益于其采用的分段感知训练方案,以及一种低开销的测试时扩展机制——该机制从共享前缀的KV缓存中分叉出N条随机 rollout,从而显著提升效率。
DFlash:用于闪速推测解码的块扩散方法
DFlash是一种基于块扩散推测解码的框架,能够在前向传播中一次性生成草稿令牌,并让草稿模型基于目标模型的上下文特征进行条件生成,在多种模型和任务上实现了超过6倍的无损加速,其加速效果比EAGLE-3最高提升2.5倍。
使用块扩散草稿树加速推测解码
DDTree利用块扩散草稿模型的逐位置分布,通过最佳优先堆算法在固定节点预算下选择最可能的续写内容,构建出一棵草稿树,并借助仅含祖先节点的注意力掩码,在单次目标前向传播中验证整棵树,基于DFlash进一步提升了接受长度。
