LLM生成速度到底能提升多快?
简短的回答是:在许多实际场景中,生成速度预计可提升2到6倍,若结合其他技巧,甚至可能接近8倍。最直接的证据来自DFlash,这是一个块扩散框架,在一系列模型和任务上实现了超过6倍的无损加速,比此前最先进的EAGLE-3最多快2.5倍[5]。其后续工作DFlare扩展了草稿模型,并报告称在Qwen3-4B上平均墙钟加速为5.52倍,在Qwen3-8B上为5.46倍,在20B模型上为3.91倍[2]。这些数字意味着,原本需要10秒的任务,在最佳情况下可能不到2秒就能完成。
更令人印象深刻的是,Spiffy证明了推测解码可以成倍放大其他加速技术的收益,在与KV缓存和多令牌去掩码结合时,总加速比最高可达7.9倍[4]。对于实时聊天或代码补全这类对延迟敏感的应用来说,这是一个巨大的实际优势。不过,这些是峰值数据;实际加速效果取决于工作负载,我们接下来会看到这一点。
是什么让块扩散草稿解码比旧方法快这么多?
传统的投机解码仍然逐字生成草稿令牌,这造成了瓶颈。块扩散草稿生成通过单次前向传播预测整块令牌,打破了这一限制,因此草稿生成阶段不再需要顺序执行[5][3]。这之所以可行,是因为扩散模型能够并行生成多个位置,并且草稿模型以目标模型的内部特征为条件,从而提升准确性[5][2]。
让这一机制高效运作的关键,在于草稿模型如何利用目标模型的知识。DFlash最初仅使用来自少数目标层的单一融合表示,而DFlare在此基础上进行了改进,让每个草稿层都能关注其自身对应的目标层组合,从而在4B模型上提速约11%,在8B模型上提速约8%[2]。另一种方法DART则采用并行logit预测,完全消除了自回归式展开,实现了2.03倍至3.44倍的加速,平均比EAGLE-3高出30%[3]。要点在于:草稿模型越能有效利用目标模型的隐藏状态,接受率就越高,生成速度也就越快。
块扩散推测解码在哪些情况下无法带来加速?
最大的注意事项是,收益并不均衡。AngelSpec发现,没有任何一种草稿生成结构能在所有工作负载下都表现最佳:块扩散在代码和数学任务上表现出色(这些任务具有可预测的长续写),而自回归多令牌预测则更适合高熵的开放式对话[1]。这意味着,针对代码生成优化的系统可能无法同样显著地加速创意写作。
另一个问题是随机采样。DBLast 指出,当目标模型采用非贪婪解码(这在创意类任务中很常见)时,接受草稿的长度会随着采样分布的熵增加而下降 [6]。通俗地说,输出越不可预测,草稿模型就越难准确猜测,从而降低加速效果。FlexDraft 也强调,在大批量处理时,由于奖励令牌和接受长度存在不确定性,并行起草与验证的性能可能受损,导致吞吐量提升失效 [7]。因此,尽管块扩散是一个强大的工具,但它并非万能方案——它最适合可预测的任务和适中的批量大小。
最后,草稿模型的质量也很关键。DFlare 表明,增加草稿模型的深度并将训练数据从 80 万样本扩展到 240 万样本,能带来持续的性能提升 [2],但这需要额外的训练资源。对于较小的团队而言,除非工作负载非常契合,否则这种开销可能并不划算。
关于这些资料来源
该回答基于7项研究(均为预印本)——发表于2025年至2026年,其中7项来自2024年或之后——这些研究是从9项通过质量筛选的研究中选出的最相关者,而9项研究又源自从超过5亿篇论文的数据库中检索到的25篇文献。
本文引用的文献
AngelSpec:面向真实世界高性能推理的投机解码方法
AngelSpec表明,块扩散草拟在代码/数学任务上表现更优,而自回归MTP在对话场景中更佳;其统一框架DFly相较于自回归解码实现了1.98-2.40倍的加速,并在并发级别4-64下,吞吐量比DFlash高出10.5-11.8%。
DFlare:扩展块扩散投机解码的草稿容量
DFlare通过逐层融合实现草案容量的扩展,在Qwen3-4B上平均加速5.52倍,在Qwen3-8B上加速5.46倍,在GPT-OSS-20B上加速3.91倍,相比DFlash提升了5-11%。
DART:受扩散启发的推测性解码,用于快速大语言模型推理
DART通过并行预测多个掩码位置,消除了自回归草稿生成过程,实现了2.03倍至3.44倍的端到端加速,平均性能比EAGLE-3高出30%。
Spiffy:通过无损推测解码实现扩散大语言模型加速的倍增
Spiffy是一种针对扩散式大语言模型的无损推测解码算法,单独使用可实现2.8至3.1倍的加速,与KV缓存和多令牌去掩码技术结合时,加速效果最高可达7.9倍。
DFlash:用于闪速推测解码的块扩散方法
DFlash采用块扩散草稿模型,在一次前向传播中生成整个块,实现了超过6倍的无损加速,且加速比相比EAGLE-3最高提升2.5倍。
DBLAST:面向随机投机解码的依赖块草拟方法
DBLast解决了独立块采样与随机解码之间的不匹配问题,表明接受草稿长度会随着熵的增高而下降,并提出了一种依赖块起草器,在创意写作基准上提升了接受长度。
FlexDraft:通过注意力调优与奖励引导校准的灵活投机解码
FlexDraft引入了注意力调优和奖励引导校准机制,以适应不同的批处理大小,通过动态切换并行与顺序草稿生成,防止大批次下吞吐量骤降。
