[ICLR 2025 投稿] 扩散模型真的比自回归模型更“博大精深”?揭秘 dLLM 的层级冗余与推理加速
Skip to the Good Part: Representation Structure & Inference-Time Layer Skipping in Diffusion vs. Autoregressive LLMs
本文提出了针对扩散语言模型(dLLMs)的内部表示结构分析,并引入了一种推理时层跳过(Layer Skipping)方法。研究发现,原生 dLLMs(如 LLaDA)具有显著的层级冗余,通过在推理时静态跳过不重要的层,可在保持 90% 以上性能的同时减少 18.75% 的 FLOPs。
TL;DR
最新的研究发现,扩散语言模型(dLLMs)在内部表示上与自回归(AR)模型有着本质区别:dLLMs 的早期层存在极高的逻辑冗余。利用这一特性,我们可以在推理时不修改任何架构,直接“跳过”部分隐藏层。实验证明,原生扩散模型 LLaDA 在减少 18.75% FLOPs 的情况下,性能几乎无损;而传统的 AR 模型(如 Qwen2.5)在同等条件下会迅速丧失逻辑能力。
1. 动机:当“逐字翻译”遇到“全文润色”
传统的自回归模型(AR)像是一个翻译官,必须看着前面的字才能写下一个字(Next-Token Prediction)。这种机制导致它每一层都在进行增量更新,每一层都不可或缺。
而扩散语言模型(dLLMs)更像是一个编辑,它面对的是全文的降噪(Denoising)。作者提出一个直觉:这种“全局反馈”是否会让模型在底层就已经完成了大部分宏观构思,从而产生冗余?
图 1:dLLMs 的层跳过机制:直接旁路高相似度层,将状态传递给下一层。
2. 核心发现:扩散目标的“降维打击”
通过对 LLaDA (原生扩散)、Qwen2.5 (原生 AR) 和 Dream-7B (AR 初始化的扩散) 进行层间相似度分析,研究者发现了三个关键现象:
- 由粗到精的抽象 (Coarse-to-fine):原生 dLLM 的前 60%-70% 层表现出极高的余弦相似度(>0.95),这意味着这些层在做重复工作,直到最后几层才进行精细特征刻画。
- 拒绝“近因偏见” (Recency Bias):AR 模型倾向于关注最近的 Token,而 dLLM 的早期层表现出极强的全局一致性,Token 间的转换极其平滑。
- 不可磨灭的“出身” (Initialization Bias):即便使用扩散目标进行微调,由 Qwen2.5 初始化的 Dream-7B 依然保留了 AR 那种“层层紧密耦合”的特性。这意味着,训练目标虽然重要,但权重的初始结构决定了冗余的上限。
图 2:层间相似度对比。黄色区域越高表示冗余度越高。可见 LLaDA(顶行)在早期拥有大片黄色冗余区,而 Qwen 和 Dream 则层级分明。
3. 方法论:跳过那些“带薪摸鱼”的层
既然 dLLM 的早期层在干重复活,作者提出 Algorithm 1:
- 测量相似度:在训练阶段或验证集上计算连续层间的余弦相似度。
- 静态选择:挑出相似度大于 (默认 0.95)的层。
- 非连续跳过:为了保证表示的稳定性,不允许连续跳过相邻的两层。
这种方法无需 KV-Cache 共享(因为每一层跳过都是独立的),也不需要像 YOCO 架构那样重新设计模型。
4. 实验战绩:扩散模型的降本增效
在 GSM8K(数学推理)、HumanEval(代码生成)等硬核榜单上,实验结果令人震惊:
| 模型 | 跳过层数 | FLOPs 减少 | 性能保持率 (GSM8K) |
|---|---|---|---|
| LLaDA (Native dLLM) | 6 层 | 18.75% | 91.8% |
| Qwen2.5 (Native AR) | 2 层 | 7.14% | 34.9% (崩溃) |
| Dream-7B (AR-Init) | 2 层 | 7.14% | 84.6% |
图 3:性能-效率权衡图。LLaDA(蓝色实线)表现出极强的韧性,而 AR 模型(绿色)随跳过层数增加迅速崩盘。
5. 深度洞察:为什么 AR 模型不行?
AR 模型本质上是一种因果特征建模,每一层都在为下一个 Token 的概率分布积累微小的证据(Incremental Refinement)。这种“步步为营”的结构导致其表示空间极其紧凑,任何一层的缺失都会破坏后续的逻辑链条。
相比之下,dLLM 在训练时被迫从噪声中恢复全局结构,这促使模型在底层就建立起了一种类似“草图”的宏观表示,后续层只是在进行“细节上色”。这种重全局、轻局部的训练目标,天然赋予了模型更强的鲁棒性。
6. 总结与展望
这项研究为我们展示了扩散语言模型相较于自回归模型的独特优势——内置的计算冗余。这不仅是学术上的新发现,更具有巨大的工程价值:
- 推理加速:无需复杂的蒸馏,通过简单的层跳过即可实现近 20% 的提速。
- 模型设计:未来的 dLLM 或许可以设计成“头重脚轻”的非对称架构,进一步压榨效率。
局限性:目前这种跳过策略是静态的。未来如果能根据问题的难易程度自动决定跳过哪些层(Dynamic Skipping),或许能实现更惊人的推理加速。
Senior Academic Editor's Take: 这是一篇视角独特的论文。它不仅在刷榜,更是在试图回答“不同训练策略如何塑造模型大脑”的深层研究。对于关注模型部署和推理优化的开发者来说,理解这种目标诱导的冗余 (Objective-induced Redundancy) 是从底层优化性能的关键。
