[arXiv 2025] dLLM:打破 DLM 的黑盒,打造统一的扩散语言模型全栈框架
dLLM: Simple Diffusion Language Modeling
本文推出了 dLLM,一个统一的扩散语言模型(DLM)开源框架,整合了训练、推理与评估全流程。该框架支持 Masked Diffusion 和 Block Diffusion 等核心算法,并提供了一系列将 BERT 或自回归模型转换为 DLM 的轻量级方案(Recipes),实现了与现有 SOTA 模型(如 LLaDA, Dream)一致的性能。
TL;DR
扩散语言模型(DLM)正成为自回归模型(ARLM)强有力的竞争者,但其开发门槛高、复现难。加州大学伯克利分校(UC Berkeley)等机构推出的 dLLM 框架,通过统一 Trainer、Sampler 和 Evaluation 接口,不仅让 LLaDA、Dream 等 SOTA 模型能够一键复现,还证明了仅需微量的 SFT 算力,就能将 BERT 或 Qwen 等传统模型逆向转化为高性能的扩散生成模型。
1. 痛点:为什么 DLM 领域需要一个“全家桶”?
在 DLM 的快速演进中,学术界正面临一个尴尬局面:每个研究团队都在维护自己的一套 Ad-hoc 代码库。
- 逻辑耦合:扩散算法的过程(降噪、掩码调度)往往与特定的神经网络架构绑定,极难迁移。
- 复现陷阱:DLM 对超参数的敏感度远超自回归模型。如图 5 所示,仅仅是一个
<eos>抑制策略或采样步数的微调,就可能导致性能断崖式下跌。 - 效率瓶颈:尽管 Fast-dLLM 等算法能加速推理,但将其集成到现有模型中往往涉及大量的重构工作。
2. 核心机理:dLLM 的模块化解法
dLLM 的核心思想是将 DLM 的生命周期解耦为三个标准化阶段:
2.1 统一 Trainer(训练端)
dLLM 提供了 MDLMTrainer(掩码扩散)和 BD3LMTrainer(块扩散)。
- 技术直觉:它将扩散逻辑(Diffusion Logic)与模型 backbone 分离。这意味着你可以把任何一个 BERT-style 的 Encoder 或者 Llama-style 的 Decoder 丢进去,而不需要改写其前向传播代码。

2.2 插件式 Sampler(推理端)
为了加速推理,dLLM 引入了 Sampler 抽象层。
- Fast-dLLM 集成:通过实现
MDLMFastdLLMSampler,框架支持 KV-Cache 复用和并行解码,在不牺牲 Accuracy 的情况下实现了显著的 Throughput 提升。 - 可视化调试:框架自带终端可视化工具,可以直观观察到 Token 是如何在非线性顺序下被逐步“净化(Denoise)”出来的。
2.3 严苛的评估对齐
dLLM 的 Evaluation 模块基于 lm-evaluation-harness 进行了二次开发,手动校验并匹配了 LLaDA 等模型的官方后处理脚本,确保复现得分的真实性。
3. 创新实验:让 BERT 也能“聊天”
dLLM 最让人兴奋的贡献是提供了一系列 Recipes。
3.1 BERT-Chat 的诞生
传统认为 BERT 只能做判别任务(如分类)。但利用 dLLM 的 MDLMTrainer,作者仅通过 SFT,就将 ModernBERT 转化为了一个支持对话的扩散模型。
- 结果:ModernBERT-large-chat 在 BBH 和 MATH 等任务上居然超越了自回归的 Qwen1.5-0.5B-Chat。这证明了双向编码器(Encoder-only)在扩散机制下具备强大的生成潜力。
3.2 AR-to-Diffusion (A2D)
作者还展示了如何利用 Qwen3-0.6B 作为底座,通过 Block Diffusion (BD3LM) 转换为 DLM。
这种转换通过 SFT 即可完成,无需数千亿 Token 的持续预训练,大大降低了 DLM 的入场券成本。
4. 战绩评估:复现与加速
下表展示了在 GSM8K 等数学任务上的复现与加速对比:
可以看到,dLLM 不仅精准对齐了 Official Accuracy,通过开启 +Both(Cache + Parallel decoding),其推理速度(Tok/s)实现了数倍的飞跃。
5. 深度洞察与总结
dLLM 的发布是 DLM 领域从“炼丹式”研究迈向“标准化”工程的重要里程碑。
- 价值 (Takeaway):它证明了 DLM 的性能下限由训练决定,而上限在很大程度上受推理采样策略的影响。
- 局限性:虽然 SFT 可以快速转化模型,但在 MMLU 等通用知识基准上,DLM 目前依然稍逊于成熟的自回归 SOTA 模型。
- 启示:未来的 DLM 研究应当更多关注如何利用现有的 ARLM 遗产,通过高效的适配器(Adaptation)而非从零开始训练。
dLLM 为我们提供了一个坚实的实验基座。由于项目已完全开源,这无疑将加速文本扩散模型在复杂推理、长文本并行生成场景下的工业落进程。
