TextLDM:打破范式隔阂,用视觉扩散的配方重塑语言建模

TextLDM: Language Modeling with Continuous Latent Diffusion

总结
问题
方法
结果
要点
摘要

本文提出了 TextLDM,一种基于连续隐空间扩散(Continuous Latent Diffusion)的语言模型。该方法通过 TextVAE 将离散 Token 映射为连续向量,并利用以 Flow Matching 为目标的 Diffusion Transformer (DiT) 进行预训练,在文本续写任务上达到了与 GPT-2 相当的水平。

TL;DR

长期以来,视觉生成(Diffusion/Flow Matching)与语言建模(Autoregressive)分属于两条平行的技术路线。TextLDM 成功地证明了:只要隐空间(Latent Space)训练得足够好,视觉领域的 DiT 成功算法——包括 VAE、Flow Matching、Logit-normal 调度和 CFG——可以直接应用于文本生成,并取得媲美 GPT-2 的效果。

背景定位

在学术坐标系中,TextLDM 是一项试图统一生成范式的桥梁式工作。它挑战了“文本必须自回归”的思维定式,将语言建模看作是连续空间内的轨迹 ODE 求解。

动机:为什么以前的扩散语言模型不行?

过去的研究发现,即使 VAE 的 Token 重构准确度接近 100%,其生成的隐向量在下游扩散任务中表现依然糟糕。作者敏锐地察觉到:重构精度(Fidelity)并不等于表示的有效性(Effectiveness)。对于扩散模型而言,隐空间不仅要能“还原”,还要有“语义几何结构”,以便模型在去噪轨迹上进行插值。

核心方法论:TextLDM 的两大支柱

1. 强化版的 TextVAE 与 REPA 对齐

为了解决隐空间质量问题,TextLDM 引入了 Representation Alignment (REPA)。在训练 VAE 时,模型不仅要学习如何重构 Token,还要强迫编码器的中间特征去“模仿”一个冻结的强大语言模型(如 Qwen3)的隐藏状态。

  • 直觉:借用预训练 LLM 的语义地图来约束 VAE 的隐空间分布。
  • 层级选择:实验发现对齐倒数第 3 层比对齐最后一层效果更好,因为最后一层往往过于关注 Token 预测,而忽略了丰富的局部语义。

模型架构图 图 1: TextLDM 整体架构,包含基于对齐的 TextVAE 和采用 Flow Matching 的 DiT。

2. 标准化的 DiT 与 Flow Matching

在获得高质量隐空间后,TextLDM 采用了与视觉模型(如 Stable Diffusion 3)完全一致的 Flow Matching 训练配方。通过预测连接噪声与真实数据的“速度场”,模型可以一次性生成整段文本,而不需要像传统 AR 模型那样逐字扫一遍 KV Cache。

实验结果与性能对比

TextLDM 在多个数据集上展现了极强的竞争力,特别是在 768M 参数规模下,其在 ROUGE 和 MAUVE 等指标上全面超越了 GPT-2。

实验结果对比 表 1: TextLDM 与 GPT-2、其他扩散模型的性能对比,展现了其在各基准上的领先地位。

此外,TextLDM 在推理效率上具有显著优势。如图 2 所示,AR 模型的计算量随序列长度线性增长,而 TextLDM 的推理步数(NFE)在很大范围内是恒定的。

推理效率对比 图 2: TextLDM 实现更高效的并行生成。

深度洞察与总结

TextLDM 的成功揭示了一个重要的学术信号:生成模型的底层架构正在收敛

  • Inductive Bias 的通用性:过去我们认为文本的离散性是扩散模型难以逾越的障碍,但实验证明,只要通过对齐手段将离散性掩盖在连续隐空间之下,DiT 依然是“全能王”。
  • 局限性:尽管实验出色,但 TextLDM 仍是一个二阶段框架,TextVAE 的重构精度在分布偏移(OOD)时会下降,且目前尚未在大规模指令微调上验证。

结论:TextLDM 并不是简单的“把扩散模型用在文本上”,而是通过 REPA 机制解决了扩散路径在文本语义空间难以定义的难点。它让我们看到了未来在一个单一 DiT 骨干下,同时完成图像理解、视频生成和文本对话的可能性。

发现相似论文

试试这些示例

  • 查找最近其他尝试通过将离散文本映射到连续空间来改进扩散语言模型生成的 SOTA 论文。
  • 哪篇论文最早提出了 Representation Alignment (REPA) 技术,本文在文本领域对其做了哪些适配性的改进?
  • 有哪些研究正致力于构建能够同时处理图像和文本生成的统一 Diffusion Transformer (DiT) 架构?
目录
TextLDM:打破范式隔阂,用视觉扩散的配方重塑语言建模
1. TL;DR
2. 背景定位
3. 动机:为什么以前的扩散语言模型不行?
4. 核心方法论:TextLDM 的两大支柱
4.1. 1. 强化版的 TextVAE 与 REPA 对齐
4.2. 2. 标准化的 DiT 与 Flow Matching
5. 实验结果与性能对比
6. 深度洞察与总结