[arXiv 2025] Speculative Speculative Decoding:让猜测再超前一步,推理提速 5 倍
Speculative Speculative Decoding
本文提出了 Speculative Speculative Decoding (SSD) 框架及优化算法 Saguaro,通过将“草稿模型猜测”与“目标模型验证”由串行改为并行,彻底消除传统猜测解码中的串行依赖。在 Llama-3.1-70B 上实现了比传统猜测解码快 2 倍、比自回归解码快 5 倍的 SOTA 性能。
TL;DR
大语言模型生成的串行本质一直是工业界的痛点。即便有了猜测解码 (Speculative Decoding, SD),系统仍需在“猜测”和“验证”之间反复横跳。今天介绍的这篇论文《Speculative Speculative Decoding》打破了这一最后的枷锁。通过在验证阶段提前“预判”验证结果并并行开启下一轮猜测,作者提出的 Saguaro 算法在 Llama-3.1-70B 上跑出了 5x 速度,且完全无损 (Lossless)。
背景:猜测解码的“隐形墙”
在传统的 SD 流程中,流程是:草稿模型跑 步 -> 目标模型验证(并行) -> 采样 Bonus Token -> 循环。
发现问题了吗?目标模型在验证时,草稿模型在空转;草稿模型在猜测时,目标模型在等待。 虽然硬件利用率上去了,但时间步上依然是串行的。
核心直觉:异步并行 (Asynchrony)
SSD 的核心思路借鉴了 CPU 架构中的“猜测执行 (Speculative Execution)”:不再等待验证结果,而是直接预测所有可能的验证结果并并行构建缓存。
左:传统 SD 串行等待;中:SSD 异步并行;右:Saguaro 实际性能表现。
Saguaro 的三大技术支柱
1. 几何扇出 (Geometric Fan-out) 缓存构建
如果要为所有验证结果做准备,空间复杂度会爆炸()。Saguaro 提出了几何扇出策略:模型通过数学推导发现,验证接受长度遵循几何分布。因此,在短路径上分配更多的 Bonus Token 预测名额,而在长路径上减少分配,从而在有限的计算预算(Budget)内最大化缓存命中率。
2. Saguaro Sampling:预测未来的艺术
Bonus Token 的采样源自残差分布 。这个分布由于依赖目标模型,通常很难预测。 作者设计了一个天才的采样法:故意调低草稿模型在高概率 Token 上的采样权重。
- 直觉:如果你在草稿中少采样某个高频 Token,那么在验证失败时,目标模型落在这个 Token 上的概率(残差)就会变大。
- 效果:这虽然略微降低了单步接受率(Acceptance Rate),但极大地提升了 SSD 的缓存命中率。
3. Fallback 策略:Batch Size 的权衡
在大 Batch 下,缓存失效是必然的。Saguaro 发现,低 Batch 时应使用高质量草稿模型回退,而高 Batch 时应果断切换到极低延迟的非神经网络(如 n-gram)草稿模型,以防止整个 Batch 被阻塞。
实验结果:刷新 Pareto 前沿
在 Llama-3.1-70B 和 Qwen-3-32B 的测试中,Saguaro 展示了统治级的表现:
- 吞吐与延迟:在 Batch Size 为 1 时效果最惊人,达到了 5.5x 的 AR 加速。
- 跨场景稳定性:无论是代码 (HumanEval) 还是数学 (GSM8k),SSD 均稳定优于优化后的 SD。
SSD 不仅显著降低了延迟,还全面提升了吞吐量的 Pareto 前沿。
资深主编点评
SSD(以及其实现 Saguaro)不仅是一篇算法论文,更是一篇优秀的系统优化论文。它从根本上指出,LLM 推理的下一个战场不在于模型做得多小,而在于如何通过异构硬件的并行解耦(例如 4 卡验证 + 1 卡异步猜测)来抵消自回归的本性。
局限性:由于需要额外的 GPU 来运行草稿模型,这对于显存极度紧张的单卡用户并不友好。此外,该方法在高吞吐、计算密集型(Compute-bound)场景下的增益会收缩,更适合对响应延迟极度敏感的交互式对话场景。
总结
Saguaro 证明了“预判了你的预判”在 LLM 推理中是真实可行的方案。它将猜测解码从“算法层面的加速”推向了“系统架构层面的并行”,为未来超大规模模型的实时交互铺平了道路。
