[ArXiv 2024] AR vs. MDLM:谁才是生成艺术的真谛?一场针对训练范式的“公平对决”
Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison
本文对自回归(AR)与掩码扩散(MDLM)两种语言模型范式进行了严谨的受控对比研究。通过在完全相同的 50M TinyStories 文本数据和计算预算下训练,研究揭示了 MDLM 在生成多样性上具有显著优势,且训练效率已逼近传统的 AR 模型。
TL;DR
长期以来,自回归(AR)模型统治着 LLM 领域,而扩散模型(Diffusion)被认为只在图像领域封神。本文通过一项极度严谨的受控实验(Controlled Comparison)证明:MDLM(掩码扩散语言模型)的训练效率几乎与 AR 持平(仅慢 4.5%),且在防止生成文本“千篇一律”方面具有压倒性优势。
核心速览:打破迷思
在 LLM 的世界里,左向右的顺序生成似乎是天经地义。但这也带来了严重的 Prefix Mode Collapse(前缀模式坍塌):模型一旦写下开头,后续的套路基本固定。
本文作者在相同的 H100 显卡、相同的 TinyStories 数据集(50M 标记)下,将 AR 与最近火热的性能代表 MDLM 放在同一竞技场。其结果不仅揭示了扩散模型在文本生成上的潜力,更给出了一组颠覆认知的实验数据。
1. 痛点:被锁死的“左向右”思维
传统的 AR 模型(如 GPT 系列)通过 Teacher Forcing 训练,推理时每个词都依赖于前面的前缀。其局限性显而易见:
- 无法修正:写错一个词,后面步步错。
- 多样性匮乏:一旦概率最高的路径被选中,生成的文本往往高度雷同。
而以 MDLM 为代表的离散扩散模型,正如画师作画一般——先打轮廓(随机掩码),再迭代润色(去噪),这赋予了模型“全局视野”。
2. 实验架构:公平的代价
为了确保实验的纯粹性,作者仅改变了范式相关的变量:
- 注意力机制:AR 使用 Causal Mask(因果掩码);MDLM 使用双向 Transformer 允许全局注意。
- 目标函数:AR 预测下一词;MDLM 预测被掩码部分。
- 参数溢价:MDLM 为了处理时间步(Timestep)建模,参数量增加了约 31.6%(从 123M 到 162M),这被视为扩散模型的固有架构成本。

3. 深度洞察:效率与收敛的奇点
吞吐量平原:扩散模型真的慢吗?
一个重大的发现是:在 H100 上,MDLM 的吞吐量达到了 48,343 tokens/s,仅比 AR 慢了不到 5%。这意味着扩散模型训练中的采样和掩码开销,在强大的并行计算面前微不足道。
收敛曲线的错位
更有趣的是两者展现出的 收敛动态(Convergence Dynamics):
- AR 模型:起步极快,但在 1.4 万步左右开始过拟合(Validation Loss 反弹)。
- MDLM 模型:起步缓慢,但在 2 万步时曲线依然陡峭向下,完全没有平整的趋势。
这说明 AR 在小样本下更容易“背书”,而 MDLM 的随机掩码机制起到了天然的正则化作用,使其具有更强的学习后劲。

4. 文本多样性的碾压
通过对 1000 个样本的定量分析,作者揭示了 MDLM 真正的杀手锏:结构多样性。
- AR 表现:99.8% 的故事开头单词是 "Once"(一旦认定这个开头概率最高,基本就不换了)。
- MDLM 表现:36.1% 的首词唯一,93.4% 的前 5 个单词组合是全新的。
在文本的流畅度(Perplexity)上,AR 依然领先;但在创意写作、打破样板化叙事上,MDLM 完胜。

5. 总结与判词:互补而非替代
这是一篇典型的“工程直觉”论文。作者明确指出,我们不应在 AR 和 Diffusion 之间二选一:
- 如果你追求极致的逻辑严密和语法流畅(如代码、翻译),AR 是不二之选。
- 如果你追求灵感迸发和叙事多样化(如创意写作、数据增强),MDLM 展现了传统 Transformer 难以企及的自由度。
局限性提示: 本研究目前处于亿级参数(M 级别)的小规模,在大规模参数(B 级别)下由于数据量巨大,AR 的过拟合问题可能会被掩盖,而扩散模型的采样步数(100 步)依然是推理端的瓶颈。
未来的研究方向很明确:如何将扩散模型的多样性融入 AR 的长文本推理中?这或许是通往通用人工智能(AGI)的另一条必经之路。
注:本文代码、模型权重及 pipeline 已全部开源在 GitHub 供复现。
