[arXiv 2026] NAP:打破扩散模型“伪并行”魔咒,开启真正非自回归推理
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
本文提出了 NAP (Non-Autoregressive Parallel DLMs),一种针对扩散语言模型 (DLMs) 的数据-解码协同设计方法。该方法通过重构训练数据为多个独立并行推理轨迹,打破了 DLM 在处理复杂推理任务时倾向于退化为类自回归 (AR-like) 行为的僵局,在保持高并行的同时显著提升了数学推理性能。
TL;DR
扩散语言模型 (DLMs) 承诺了高效的并行生成,但实际表现却总是“换汤不换药”地重复着从左到右的自回归老路。本文提出的 NAP (Non-Autoregressive Parallel DLMs) 指出:病灶不在算法,而在数据。通过将推理过程重构为并行的多条路径并配合“并行强制解码”策略,NAP 在 Llama 级模型上实现了推理速度与精度的双重突破,尤其在高度并行场景下表现优异。
1. “伪并行”的真相:为什么 DLM 戒不掉自回归?
在学术界的宣传中,扩散模型通过迭代去噪实现并行解码,有望彻底解决传统 LLM 推理时的 KV Cache 瓶颈。然而,资深研究者发现,大多数号称“快速”的 DLM(如 LLaDA, Dream)在推理复杂任务时,其Global ARness(衡量生成顺序与自回归重合度的指标)依然高达 0.9 以上。
核心直觉 (Insight): 目前的 DLM 管道大多直接复用为自回归模型设计的预训练语料和长 Chain-of-Thought (CoT) 数据。数据中隐含的极强顺序依赖(SeqDep)给模型洗了脑,让它认为“前一个 Token 没定,后一个就没法写”。如图所示,标准数据的序列依赖性随长度急剧增加。

2. 方法论:NAP 的“双管齐下”
为了从根本上消除这种“自回归锁死”,NAP 提出了数据与解码的协同进化。
2.1 训练侧:推理轨迹的并行重组
NAP 不再让模型学习单一的线性逻辑链。它利用更强的教师模型生成 个独立的推理轨迹(Trajectories),并将它们打包进同一个训练实例中。这样,模型在去噪过程中捕捉到的是不同逻辑块之间的条件独立性。

2.2 推理侧:并行强制解码 (Parallel-Forced Decoding)
NAP 定义了一种结构化画布。在每一个解码步,系统强制将“去噪配额”均匀分配到不同的推理块(Think Blocks)中,而不是允许模型全速冲刺前几个 Token。
- 宏观并行:多条推理路径同步演进。
- 微观置信度:块内部根据置信度选择更新位置,保留非自回归的灵活性。
3. 实验战绩:越是并行,表现越强
NAP 在常用的数学推理基准(GSM8K, MATH-500)上进行了严苛测试。
SOTA 对比
在传统的 DLM 中,如果你想加速(比如从 1024 步压缩到 256 步完成生成),准确率通常会发生断崖式下跌。但 NAP 展示了截然不同的特性:其性能领先幅度随着并行度的增加而扩大。

在 256 步 (4x Parallel) 设定下,NAP-Dream-7B 的准确率比标准 CoT 模型高出 14.4%。这证明了 NAP 真正利用了并行硬件的潜能,而不仅仅是“算得更快的自回归”。
路径可视化
观察解码轨迹图(Figure 1)可以明显看到,普通模型在 AO (Arbitrary Order) 下呈现出明显的对角线(即从左到右),而 NAP 呈现出清晰的“多条并进”带状,这是真非自回归行为的有力证据。
4. 深度洞察:数据拓扑才是关键
NAP 的成功揭示了一个深刻的学术见解:推理能力(Reasoning Ability)与序列顺序(Sequential Order)是可以解耦的。 过去我们认为 CoT 必须是 step-by-step 的长链,但实验证明,只要数据拓扑设计合理,模型可以同时在多个维度进行“并行思考”。
局限性分析: 目前 NAP 还处于 Post-training(微调)阶段,规模在 100K 样本左右。要想彻底发挥潜力,未来可能需要从预训练(Pre-training)阶段就引入非序列化数据。
5. 总结与展望
NAP 为 DLM 的研究指明了新方向:我们不应该寄希望于通过更复杂的采样算法来修正一个已经“长歪”的自回归大脑,而应该给它喂更符合并行逻辑的超级食物。这种“数据驱动的架构一致性”可能是实现万亿参数模型低延迟、高吞吐生成的最后一块拼图。
本文根据 arXiv 最新论文撰写,旨在提供深度学术见解。
