[Apple 2026] Tri-modal MDM:三模态掩码扩散模型的全设计空间探索
The Design Space of Tri-Modal Masked Diffusion Models
本文推出了首个从零预训练的三模态离散掩码扩散模型(Tri-modal MDM),支持在统一的 Transformer 架构和词表下实现文本、图像和音频的任意方向互生成。在 3B 参数量及 6.4T Token 的预训练规模下,该模型在 T2I、T2S 等多项任务中达到了 SOTA 或强竞争水平。
TL;DR
在自回归(AR)模型统治大模型领域的今天,Apple 的研究团队反其道而行之,推出了首个从零开始预训练的三模态掩码扩散模型(Tri-modal MDM)。该模型不仅在 3B 规模上实现了文本、图像、音频的统一建模,更关键的是它系统性地回答了“如何高效预训练扩散基座”的工程难题。通过 SDE 参数重构,开发者可以彻底告别繁琐的 Batch Size 调优。
1. 动机:为什么要回归“迭代精炼”?
当前的 SOTA 多模态模型(如 Gemini, GPT-4o)大多采用自回归架构。虽然 AR 模型简单且推理缓存(KV Cache)技术成熟,但它在处理“非局部约束”的任务(如图像修复、音频填补)时显得力不从心。
Masked Diffusion Models (MDM) 引入了双向信息流。它将生成过程看作是一个迭代去噪的过程:从全掩码状态开始,逐步填充缺失的 Token。这种“全序无关”的生成方式天然适合多模态补全,而不需要为每种生成任务重新定义因式分解顺序。
2. 核心挑战:三模态大一统的“设计空间”
将文本(Tiktoken)、图像(MoVQGAN)和音频(Higgs Audio v2)离散化并丢进同一个 Transformer 容器只是第一步。真正的难点在于如何确保在千卡并行的预训练中保持稳定和高效。
2.1 架构与词表
作者设计了一个巨大的统一词表(约 11.7 万 Token),包含模态特有的 [MASK]、[BOS] 以及任务指令(TASK)Token。模型采用标准的二向 Transformer 架构,辅以 RMSNorm 和 RoPE 嵌入。

3. 关键技术创新
3.1 基于 SDE 的参数重构:消灭
在传统的深度学习实践中,改变 Batch Size 通常需要重新寻找最优学习率。作者利用 Stochastic Differential Equation (SDE) 理论,将 AdamW 的超参数与 Batch Size 挂钩。
- 直觉:Batch Size 的本质是控制梯度噪声。
- 效果:只要 Batch Size 低于某个“临界阈值” (),无论物理上使用 256 还是 3072 的批大小,最终的收敛曲线几乎完美重合。

3.2 Anti-masking:免费的性能提升
扩散模型训练中存在高方差问题。作者引入了 Anti-masking:对同一个样本生成两个互补的掩码状态(例如,一个掩码掉 0-50%,另一个掩码掉 50-100%)。这种方法有效稳定了梯度方向。实验证明,在计算量对齐(Compute-matched)的情况下,Anti-masking 能在多任务 Benchmark 上带来可观的稳步提升。
4. 三模态缩放定律 (Scaling Laws)
通过对 262 个不同规模模型的扫描,作者给出了三模态 MDM 的“说明书”:
深度洞察:作者发现 MDM 在数据效率上表现出显著的异质性。对于 3B 规模的模型,MDM 需要约 480B 的 Token 才能达到计算最优,这远超 AR 模型传统 Chinchilla 定律所建议的规模。这意味着 MDM 是“慢热型”选手——规模越大,数据利用效率的优势越明显。

5. 实验分析:模态间的相互“排斥”?
在针对模态混合比例(Modality Mixing Ratios)的实验中,作者发现了一个有趣的结论:
- 在当前规模下,不同模态之间并没有表现出明显的“协同效应”。
- 文本、图像、音频似乎在竞争模型的表达能力(Capacity)。当一种模态的比例增加,该模态的 Loss 会下降,但其他模态并不会因此获益。这暗示了在实现真正的多模态“涌现”之前,增加模型参数量依旧是硬道理。
6. 总结与展望
Apple 的这项工作建立了多模态离散扩散模型的工程基准。虽然 MDM 的采样速度(需要迭代多次)目前仍慢于单次生成的 AR 模型,但其在跨模态建模、抗噪声能力和计算最优路径上的独特性,使其成为了通往 Physical AI 和通用多模态生成的重要备选方案。
关键 Takeaways:
- 超参转移:SDE Reparameterization 实现了真正的“零样本”超参迁移。
- 数据效率:在大规模场景下,MDM 的参数增长与数据量增长关系比 AR 模型更紧密。
- 统一性:无需任何模态特定的 Head,一个 Backbone 搞定一切。
