[arXiv 2026] NAP:打破扩散模型“伪并行”魔咒,开启真正非自回归推理

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

总结
问题
方法
结果
要点

本文提出了 NAP (Non-Autoregressive Parallel DLMs),一种针对扩散语言模型 (DLMs) 的数据-解码协同设计方法。该方法通过重构训练数据为多个独立并行推理轨迹,打破了 DLM 在处理复杂推理任务时倾向于退化为类自回归 (AR-like) 行为的僵局,在保持高并行的同时显著提升了数学推理性能。

TL;DR

扩散语言模型 (DLMs) 承诺了高效的并行生成,但实际表现却总是“换汤不换药”地重复着从左到右的自回归老路。本文提出的 NAP (Non-Autoregressive Parallel DLMs) 指出:病灶不在算法,而在数据。通过将推理过程重构为并行的多条路径并配合“并行强制解码”策略,NAP 在 Llama 级模型上实现了推理速度与精度的双重突破,尤其在高度并行场景下表现优异。


1. “伪并行”的真相:为什么 DLM 戒不掉自回归?

在学术界的宣传中,扩散模型通过迭代去噪实现并行解码,有望彻底解决传统 LLM 推理时的 KV Cache 瓶颈。然而,资深研究者发现,大多数号称“快速”的 DLM(如 LLaDA, Dream)在推理复杂任务时,其Global ARness(衡量生成顺序与自回归重合度的指标)依然高达 0.9 以上。

核心直觉 (Insight): 目前的 DLM 管道大多直接复用为自回归模型设计的预训练语料和长 Chain-of-Thought (CoT) 数据。数据中隐含的极强顺序依赖(SeqDep)给模型洗了脑,让它认为“前一个 Token 没定,后一个就没法写”。如图所示,标准数据的序列依赖性随长度急剧增加。

训练数据序列依赖性分析


2. 方法论:NAP 的“双管齐下”

为了从根本上消除这种“自回归锁死”,NAP 提出了数据与解码的协同进化。

2.1 训练侧:推理轨迹的并行重组

NAP 不再让模型学习单一的线性逻辑链。它利用更强的教师模型生成 个独立的推理轨迹(Trajectories),并将它们打包进同一个训练实例中。这样,模型在去噪过程中捕捉到的是不同逻辑块之间的条件独立性

NAP数据格式示例

2.2 推理侧:并行强制解码 (Parallel-Forced Decoding)

NAP 定义了一种结构化画布。在每一个解码步,系统强制将“去噪配额”均匀分配到不同的推理块(Think Blocks)中,而不是允许模型全速冲刺前几个 Token。

  • 宏观并行:多条推理路径同步演进。
  • 微观置信度:块内部根据置信度选择更新位置,保留非自回归的灵活性。

3. 实验战绩:越是并行,表现越强

NAP 在常用的数学推理基准(GSM8K, MATH-500)上进行了严苛测试。

SOTA 对比

在传统的 DLM 中,如果你想加速(比如从 1024 步压缩到 256 步完成生成),准确率通常会发生断崖式下跌。但 NAP 展示了截然不同的特性:其性能领先幅度随着并行度的增加而扩大。

解码性能对比图

256 步 (4x Parallel) 设定下,NAP-Dream-7B 的准确率比标准 CoT 模型高出 14.4%。这证明了 NAP 真正利用了并行硬件的潜能,而不仅仅是“算得更快的自回归”。

路径可视化

观察解码轨迹图(Figure 1)可以明显看到,普通模型在 AO (Arbitrary Order) 下呈现出明显的对角线(即从左到右),而 NAP 呈现出清晰的“多条并进”带状,这是真非自回归行为的有力证据。


4. 深度洞察:数据拓扑才是关键

NAP 的成功揭示了一个深刻的学术见解:推理能力(Reasoning Ability)与序列顺序(Sequential Order)是可以解耦的。 过去我们认为 CoT 必须是 step-by-step 的长链,但实验证明,只要数据拓扑设计合理,模型可以同时在多个维度进行“并行思考”。

局限性分析: 目前 NAP 还处于 Post-training(微调)阶段,规模在 100K 样本左右。要想彻底发挥潜力,未来可能需要从预训练(Pre-training)阶段就引入非序列化数据。


5. 总结与展望

NAP 为 DLM 的研究指明了新方向:我们不应该寄希望于通过更复杂的采样算法来修正一个已经“长歪”的自回归大脑,而应该给它喂更符合并行逻辑的超级食物。这种“数据驱动的架构一致性”可能是实现万亿参数模型低延迟、高吞吐生成的最后一块拼图。


本文根据 arXiv 最新论文撰写,旨在提供深度学术见解。

发现相似论文

试试这些示例

  • 查找最近其他探讨训练数据序列依赖(Sequential Dependence)对非自回归模型生成行为影响的研究论文。
  • 哪篇论文最早提出了多路径推理(Parallel Thinking)的概念,NAP 在数据构造上与其有何异同?
  • 探索将 NAP 的并行推理架构应用到多模态扩散模型或长视频生成的可能性,是否有相关研究已在进行?
目录
[arXiv 2026] NAP:打破扩散模型“伪并行”魔咒,开启真正非自回归推理
1. TL;DR
2. 1. “伪并行”的真相:为什么 DLM 戒不掉自回归?
3. 2. 方法论:NAP 的“双管齐下”
3.1. 2.1 训练侧:推理轨迹的并行重组
3.2. 2.2 推理侧:并行强制解码 (Parallel-Forced Decoding)
4. 3. 实验战绩:越是并行,表现越强
4.1. SOTA 对比
4.2. 路径可视化
5. 4. 深度洞察:数据拓扑才是关键
6. 5. 总结与展望