[ICLR 2025 投稿] 扩散模型真的比自回归模型更“博大精深”?揭秘 dLLM 的层级冗余与推理加速

Skip to the Good Part: Representation Structure & Inference-Time Layer Skipping in Diffusion vs. Autoregressive LLMs

总结
问题
方法
结果
要点
摘要

本文提出了针对扩散语言模型(dLLMs)的内部表示结构分析,并引入了一种推理时层跳过(Layer Skipping)方法。研究发现,原生 dLLMs(如 LLaDA)具有显著的层级冗余,通过在推理时静态跳过不重要的层,可在保持 90% 以上性能的同时减少 18.75% 的 FLOPs。

TL;DR

最新的研究发现,扩散语言模型(dLLMs)在内部表示上与自回归(AR)模型有着本质区别:dLLMs 的早期层存在极高的逻辑冗余。利用这一特性,我们可以在推理时不修改任何架构,直接“跳过”部分隐藏层。实验证明,原生扩散模型 LLaDA 在减少 18.75% FLOPs 的情况下,性能几乎无损;而传统的 AR 模型(如 Qwen2.5)在同等条件下会迅速丧失逻辑能力。

1. 动机:当“逐字翻译”遇到“全文润色”

传统的自回归模型(AR)像是一个翻译官,必须看着前面的字才能写下一个字(Next-Token Prediction)。这种机制导致它每一层都在进行增量更新,每一层都不可或缺。

而扩散语言模型(dLLMs)更像是一个编辑,它面对的是全文的降噪(Denoising)。作者提出一个直觉:这种“全局反馈”是否会让模型在底层就已经完成了大部分宏观构思,从而产生冗余?

层跳过机制示意图 图 1:dLLMs 的层跳过机制:直接旁路高相似度层,将状态传递给下一层。

2. 核心发现:扩散目标的“降维打击”

通过对 LLaDA (原生扩散)、Qwen2.5 (原生 AR) 和 Dream-7B (AR 初始化的扩散) 进行层间相似度分析,研究者发现了三个关键现象:

  1. 由粗到精的抽象 (Coarse-to-fine):原生 dLLM 的前 60%-70% 层表现出极高的余弦相似度(>0.95),这意味着这些层在做重复工作,直到最后几层才进行精细特征刻画。
  2. 拒绝“近因偏见” (Recency Bias):AR 模型倾向于关注最近的 Token,而 dLLM 的早期层表现出极强的全局一致性,Token 间的转换极其平滑。
  3. 不可磨灭的“出身” (Initialization Bias):即便使用扩散目标进行微调,由 Qwen2.5 初始化的 Dream-7B 依然保留了 AR 那种“层层紧密耦合”的特性。这意味着,训练目标虽然重要,但权重的初始结构决定了冗余的上限。

相似度热力图对比 图 2:层间相似度对比。黄色区域越高表示冗余度越高。可见 LLaDA(顶行)在早期拥有大片黄色冗余区,而 Qwen 和 Dream 则层级分明。

3. 方法论:跳过那些“带薪摸鱼”的层

既然 dLLM 的早期层在干重复活,作者提出 Algorithm 1:

  • 测量相似度:在训练阶段或验证集上计算连续层间的余弦相似度。
  • 静态选择:挑出相似度大于 (默认 0.95)的层。
  • 非连续跳过:为了保证表示的稳定性,不允许连续跳过相邻的两层。

这种方法无需 KV-Cache 共享(因为每一层跳过都是独立的),也不需要像 YOCO 架构那样重新设计模型。

4. 实验战绩:扩散模型的降本增效

在 GSM8K(数学推理)、HumanEval(代码生成)等硬核榜单上,实验结果令人震惊:

模型跳过层数FLOPs 减少性能保持率 (GSM8K)
LLaDA (Native dLLM)6 层18.75%91.8%
Qwen2.5 (Native AR)2 层7.14%34.9% (崩溃)
Dream-7B (AR-Init)2 层7.14%84.6%

性能与效率折线图 图 3:性能-效率权衡图。LLaDA(蓝色实线)表现出极强的韧性,而 AR 模型(绿色)随跳过层数增加迅速崩盘。

5. 深度洞察:为什么 AR 模型不行?

AR 模型本质上是一种因果特征建模,每一层都在为下一个 Token 的概率分布积累微小的证据(Incremental Refinement)。这种“步步为营”的结构导致其表示空间极其紧凑,任何一层的缺失都会破坏后续的逻辑链条。

相比之下,dLLM 在训练时被迫从噪声中恢复全局结构,这促使模型在底层就建立起了一种类似“草图”的宏观表示,后续层只是在进行“细节上色”。这种重全局、轻局部的训练目标,天然赋予了模型更强的鲁棒性。

6. 总结与展望

这项研究为我们展示了扩散语言模型相较于自回归模型的独特优势——内置的计算冗余。这不仅是学术上的新发现,更具有巨大的工程价值:

  • 推理加速:无需复杂的蒸馏,通过简单的层跳过即可实现近 20% 的提速。
  • 模型设计:未来的 dLLM 或许可以设计成“头重脚轻”的非对称架构,进一步压榨效率。

局限性:目前这种跳过策略是静态的。未来如果能根据问题的难易程度自动决定跳过哪些层(Dynamic Skipping),或许能实现更惊人的推理加速。


Senior Academic Editor's Take: 这是一篇视角独特的论文。它不仅在刷榜,更是在试图回答“不同训练策略如何塑造模型大脑”的深层研究。对于关注模型部署和推理优化的开发者来说,理解这种目标诱导的冗余 (Objective-induced Redundancy) 是从底层优化性能的关键。

发现相似论文

试试这些示例

  • 查找最近关于扩散语言模型 (dLLMs) 在推理加速、蒸馏或模型压缩方面的最新 SOTA 论文。
  • 哪篇论文最早探讨了自回归模型 (AR-LLMs) 的层级冗余性,本文提到的“初始化偏见”在其他模型迁移学习中是否有类似发现?
  • 有哪些研究将层跳过 (Layer Skipping) 或动态早停 (Early Exit) 技术应用到了多模态扩散模型或图像生成任务中?
目录
[ICLR 2025 投稿] 扩散模型真的比自回归模型更“博大精深”?揭秘 dLLM 的层级冗余与推理加速
1. TL;DR
2. 1. 动机:当“逐字翻译”遇到“全文润色”
3. 2. 核心发现:扩散目标的“降维打击”
4. 3. 方法论:跳过那些“带薪摸鱼”的层
5. 4. 实验战绩:扩散模型的降本增效
6. 5. 深度洞察:为什么 AR 模型不行?
7. 6. 总结与展望