[ICLR 2025] LK Losses:拒绝代理指标,直接为“接受率”而战的投机采样新方案
LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding
本文提出了 LK Losses,一种旨在直接优化投机采样(Speculative Decoding)中“接受率”的训练目标函数。通过引入负对数接受率损失(Likelihood-based)和带有自适应权重的混合损失(Hybrid Objective),该方法在从 8B 到 685B 参数的多种模型架构上,实现了 8-10% 的平均接受长度提升。
TL;DR
投机采样(Speculative Decoding)的效率核心在于接受率(Acceptance Rate)。长期以来,开发者习惯用 KL 散度来训练投机模型(Draft Model),但这其实是一个“不完美”的代理指标。本文提出的 LK Losses 拨乱反正,通过数学推导和实验证明:直接优化接受率不仅理论更完备,且在无需任何额外推理开销的前提下,能将主流 LLM 的推理加速性能提升 8-10%。
背景定位:代理指标的局限性
在投机采样的范式中,我们希望小模型 尽可能预测大模型 的行为。在理想状况下(全球最优解),,此时 KL 散度和接受率确实是统一的。 然而,现实很残酷:
- 容量瓶颈:投机模型通常只有目标模型参数的 1%~5%,它永远不可能真正复现大模型的分布。
- 优化偏好:当模型容量不足时,KL 散度倾向于平均分配概率质量(Mode-covering),而接受率的提升则需要模型更精准地捕捉高频 Token(Mode-seeking)。
作者通过一个简单的混合高斯拟合(见下图)展示了直觉:总变分距离(Total Variation, TV) 寻找的解能产生最大的分布重叠区域,从而直接最大化接受率。

动机与深度洞察:为什么不直接用 TV 距离?
既然 TV 距离直接等价于 ,为什么前人不用它作为 Loss? 通过梯度分析,作者揭示了三个痛点:
- 梯度消失:在初始化阶段,由于预测分布比较平滑,TV 的梯度幅值是 ,在词表规模 的今天,这个梯度几乎为零。
- 不连续性:TV 损失的曲面在 处不可微,优化不稳定。
- 忽略误差量级:TV 的梯度只看误差的方向(正负号),而不看差距有多大,这导致训练早期收敛极慢。
核心方法论:LK Losses
为了解决上述梯度问题,作者提出了两种极具工程智慧的 Loss 设计:
1. 似然优化法 ()
公式定义为:。 物理直觉:这相当于在 TV 梯度的基础上,乘以了一个 的缩放因子。当接受率 很低时,梯度被自动放大;当 接近 1 时,梯度回归正常。这巧妙地解决了 TV 损失在早期的梯度消失问题。
2. 自适应混合调度 ()
这是一种更稳健的课程学习策略: 其中 会随着当前 Batch 的实时接受率 动态衰减。
- 初期: 低, 接近 1,利用 KL 散度平滑的曲面快速把模型拉入“信任区域”。
- 后期: 提高, 减小,模型开始专注优化接受率,做最后的冲刺。

实验结果:全方位的 SOTA 提升
实验覆盖了从 Llama-3 (8B/70B) 到巨大规模的 DeepSeek-V3 (685B) 的多组对比。
- 广泛的适配性:无论是并行的 MEDUSA 头,还是递归的 EAGLE 架构,LK Losses 均稳定优于 KL 散度。
- 低容量增益更高:在架构更简单的 MTP 或 MEDUSA 上,由于模型更难拟合完整分布,直接优化接受率带来的红利更加可观(提升 5.6%~8.3%)。
- 复杂领域表现:在编程 (HumanEval) 和数学 (GSM8K) 任务中,平均接受长度 的提升尤为明显,因为这些领域对 Token 的精确性要求极高。

深度思考与局限性
LK Losses 揭示了**“指标对齐”**在系统优化中的重要性。然而,该方法目前主要针对“接受率”这一 Token 级别的指标。作者也客观指出,未来的终极目标应该是直接优化“系统推理延迟”,但这涉及更多非确定性的硬件环境因素。
此外,对于已经极度强大的 Draft Model,LK Losses 的边际效应会递减。但对于大多数仍在努力提升小模型推理效率的场景,LK Losses 提供了一个零成本、即插即用的性能 Buff。
总结
LK Losses 告诉我们,有时候数学上的“完美代理”在有限的工程约束下并非最优解。通过深入理解梯度动态并引入自适应机制,我们可以让投机采样跑得更远。
关键词:Speculative Decoding, Acceptance Rate, KL Divergence, Total Variation, DeepSeek-V3
