[arXiv 2025] dLLM:打破 DLM 的黑盒,打造统一的扩散语言模型全栈框架

dLLM: Simple Diffusion Language Modeling

总结
问题
方法
结果
要点
摘要

本文推出了 dLLM,一个统一的扩散语言模型(DLM)开源框架,整合了训练、推理与评估全流程。该框架支持 Masked Diffusion 和 Block Diffusion 等核心算法,并提供了一系列将 BERT 或自回归模型转换为 DLM 的轻量级方案(Recipes),实现了与现有 SOTA 模型(如 LLaDA, Dream)一致的性能。

TL;DR

扩散语言模型(DLM)正成为自回归模型(ARLM)强有力的竞争者,但其开发门槛高、复现难。加州大学伯克利分校(UC Berkeley)等机构推出的 dLLM 框架,通过统一 Trainer、Sampler 和 Evaluation 接口,不仅让 LLaDA、Dream 等 SOTA 模型能够一键复现,还证明了仅需微量的 SFT 算力,就能将 BERT 或 Qwen 等传统模型逆向转化为高性能的扩散生成模型。

1. 痛点:为什么 DLM 领域需要一个“全家桶”?

在 DLM 的快速演进中,学术界正面临一个尴尬局面:每个研究团队都在维护自己的一套 Ad-hoc 代码库。

  • 逻辑耦合:扩散算法的过程(降噪、掩码调度)往往与特定的神经网络架构绑定,极难迁移。
  • 复现陷阱:DLM 对超参数的敏感度远超自回归模型。如图 5 所示,仅仅是一个 <eos> 抑制策略或采样步数的微调,就可能导致性能断崖式下跌。
  • 效率瓶颈:尽管 Fast-dLLM 等算法能加速推理,但将其集成到现有模型中往往涉及大量的重构工作。

2. 核心机理:dLLM 的模块化解法

dLLM 的核心思想是将 DLM 的生命周期解耦为三个标准化阶段:

2.1 统一 Trainer(训练端)

dLLM 提供了 MDLMTrainer(掩码扩散)和 BD3LMTrainer(块扩散)。

  • 技术直觉:它将扩散逻辑(Diffusion Logic)与模型 backbone 分离。这意味着你可以把任何一个 BERT-style 的 Encoder 或者 Llama-style 的 Decoder 丢进去,而不需要改写其前向传播代码。 训练接口设计

2.2 插件式 Sampler(推理端)

为了加速推理,dLLM 引入了 Sampler 抽象层。

  • Fast-dLLM 集成:通过实现 MDLMFastdLLMSampler,框架支持 KV-Cache 复用和并行解码,在不牺牲 Accuracy 的情况下实现了显著的 Throughput 提升。
  • 可视化调试:框架自带终端可视化工具,可以直观观察到 Token 是如何在非线性顺序下被逐步“净化(Denoise)”出来的。

2.3 严苛的评估对齐

dLLM 的 Evaluation 模块基于 lm-evaluation-harness 进行了二次开发,手动校验并匹配了 LLaDA 等模型的官方后处理脚本,确保复现得分的真实性。

3. 创新实验:让 BERT 也能“聊天”

dLLM 最让人兴奋的贡献是提供了一系列 Recipes

3.1 BERT-Chat 的诞生

传统认为 BERT 只能做判别任务(如分类)。但利用 dLLM 的 MDLMTrainer,作者仅通过 SFT,就将 ModernBERT 转化为了一个支持对话的扩散模型。

  • 结果:ModernBERT-large-chat 在 BBH 和 MATH 等任务上居然超越了自回归的 Qwen1.5-0.5B-Chat。这证明了双向编码器(Encoder-only)在扩散机制下具备强大的生成潜力。

3.2 AR-to-Diffusion (A2D)

作者还展示了如何利用 Qwen3-0.6B 作为底座,通过 Block Diffusion (BD3LM) 转换为 DLM。 训练曲线 这种转换通过 SFT 即可完成,无需数千亿 Token 的持续预训练,大大降低了 DLM 的入场券成本。

4. 战绩评估:复现与加速

下表展示了在 GSM8K 等数学任务上的复现与加速对比: 推理加速对比 可以看到,dLLM 不仅精准对齐了 Official Accuracy,通过开启 +Both(Cache + Parallel decoding),其推理速度(Tok/s)实现了数倍的飞跃。

5. 深度洞察与总结

dLLM 的发布是 DLM 领域从“炼丹式”研究迈向“标准化”工程的重要里程碑。

  • 价值 (Takeaway):它证明了 DLM 的性能下限由训练决定,而上限在很大程度上受推理采样策略的影响。
  • 局限性:虽然 SFT 可以快速转化模型,但在 MMLU 等通用知识基准上,DLM 目前依然稍逊于成熟的自回归 SOTA 模型。
  • 启示:未来的 DLM 研究应当更多关注如何利用现有的 ARLM 遗产,通过高效的适配器(Adaptation)而非从零开始训练。

dLLM 为我们提供了一个坚实的实验基座。由于项目已完全开源,这无疑将加速文本扩散模型在复杂推理、长文本并行生成场景下的工业落进程。

发现相似论文

试试这些示例

  • 查找最近发布的其他支持多种扩散策略(如 Discrete Flow Matching)的统一语言模型框架。
  • 哪篇论文首次提出了将自回归语言模型(ARLM)转换为扩散模型(A2D)的概念,其原始的 Logit Right-Shifting 技巧在本文中为何失效?
  • 有哪些最新的研究在探索利用强化学习(RL)来进一步优化扩散语言模型的推理采样路径?
目录
[arXiv 2025] dLLM:打破 DLM 的黑盒,打造统一的扩散语言模型全栈框架
1. TL;DR
2. 1. 痛点:为什么 DLM 领域需要一个“全家桶”?
3. 2. 核心机理:dLLM 的模块化解法
3.1. 2.1 统一 Trainer(训练端)
3.2. 2.2 插件式 Sampler(推理端)
3.3. 2.3 严苛的评估对齐
4. 3. 创新实验:让 BERT 也能“聊天”
4.1. 3.1 BERT-Chat 的诞生
4.2. 3.2 AR-to-Diffusion (A2D)
5. 4. 战绩评估:复现与加速
6. 5. 深度洞察与总结