WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

DepCap:自适应分块与冲突感知,让扩散语言模型推理快如闪电

DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference

总结
问题
方法
结果
要点
摘要

本文提出了 DepCap,这是一个针对扩散语言模型(DLM)的高效块状(Block-wise)并行解码框架。通过引入自适应分块和冲突感知并行解码机制,DepCap 在不需加速训练的情况下,在多个 SOTA 后端(如 LLaDA, Dream)上实现了最高 5.63 倍的推理加速。

TL;DR

扩散语言模型(DLMs)虽具备并行解码的潜力,但在实际推理中常受限于“生成质量与速度”的博弈。本文推出的 DepCap 框架,通过跨步信号引导的自适应分块 (DepGA-Block)冲突感知并行解码 (CAP-Decoding),在无需任何额外训练的前提下,将 LLaDA 等主流 DLM 的推理速度提升了 3-5 倍,甚至在部分任务中达成了“速度与精度”的双提升。

背景定位:从自回归到扩散解码的演进

传统的自回归(AR)模型逐个生成 Token,虽然稳定但限制了计算架构的并行能力。扩散语言模型(DLMs)通过全局去噪提供了并行化的可能。然而,现有的分块解码策略(Block-wise Decoding)往往面临两难:块设小了,并行度不够;块设大了,由于 Token 间的相互干扰(Conflicts),生成质量会雪崩式下降。

痛点深挖:为何固定的分块策略会失效?

  1. 缺乏时序嗅觉:大多数方法仅依据当前步的局部信息(如语义符号或即时信息熵)来断句,忽略了去噪过程是一个动态演化的系统。
  2. 置信度的盲区:高置信度并不代表 Token 之间不矛盾。两个位置各自预测的最高概率 Token,在联合分布下可能是互斥的。

核心机制:DepCap 的双重进化论

1. DepGA-Block:基于“影响力”的自适应分块

DepCap 引入了一个极具物理直觉的指标——Last-block Influence(上块影响力)。它通过计算预测分布在解码一个块前后的 KL 散度,来衡量当前已解出的信息对未来的“指导意义”。

  • 若影响力显著高于不确定性(Entropy),则继续扩大分块边界。
  • 若不确定性占主导,则视为逻辑转折点,收缩边界。

模型架构图 图 1:DepCap 框架图。对比传统固定分块(a)与自适应分块(b),后者通过跨步信号捕捉动态逻辑边界。

2. CAP-Decoding:构建“非对称冲突”过滤器

在确定块大小后,如何安全地并行?CAP-Decoding 不再单纯迷信置信度阈值,而是引入了冲突分: 通过这个轻量级得分,模型能识别出那些“我预测我时觉得你对,你也预测你时觉得我对”的和谐 Token 集,剔除掉那些相互干扰的潜在噪声。

实验战绩:全线飘红的性能提升

在 LLaDA-8B 和 Dream-7B 等模型上的测试结果足以令人振奋:

  • 极致加速:在 LLaDA-1.5 的 MBPP 任务中,TPS 提升至 5.63x
  • 质量保障:在加速的同时,GSM8K 等推理任务的 Acc 几乎没有损失,甚至因过滤了冲突 Token 而略有上升。
  • 广泛兼容:DepCap 能与现有的 KV-Cache 技术完美结合,在 Dual Cache 模式下展示了极高的吞吐效率。

实验结果对比 图 2:主流基准测试结果。DepCap 在 TPS(速度)与 Acc(准确率)之间达到了最理想的 Pareto 最优。

深度洞察:信息的累加性

作者在论文中通过信息论分析证明,在局部窗口内,上个块对未来 Token 的影响力具有近似的可加性(Additivity)。这一数学支撑验证了其“影响力得分”在逻辑边界分割上的有效性,而不仅是启发式的调参。

总结与展望

DepCap 证明了 DLM 的推理加速不一定非要依赖模型压缩或蒸馏,通过更聪明的解码策略同样能榨取出巨大的算力潜能。尽管该方法在超长文本(>1024 tokens)时仍面临质量下降的挑战,但它为非自回归大模型(NAR)进入实时交互领域铺平了道路。

未来,这种自适应边界的思想或许可以进一步扩展到“动态窗口滑动”或“多模态多维去噪”任务中。

发现相似论文

试试这些示例

  • 查找其他最近试图解决扩散语言模型(Diffusion Language Models)推理延迟或去噪步数(NFE)优化问题的论文。
  • 哪篇论文最早在扩散模型中提出了 Block-wise 解码策略,本文的自适应边界逻辑与该基础工作有何本质区别?
  • 有哪些研究探讨了将冲突感知(Conflict-aware)或依赖感知解码应用到多模态扩散生成模型或图像生成任务中?
目录
DepCap:自适应分块与冲突感知,让扩散语言模型推理快如闪电
1. TL;DR
2. 背景定位:从自回归到扩散解码的演进
3. 痛点深挖:为何固定的分块策略会失效?
4. 核心机制:DepCap 的双重进化论
4.1. 1. DepGA-Block:基于“影响力”的自适应分块
4.2. 2. CAP-Decoding:构建“非对称冲突”过滤器
5. 实验战绩:全线飘红的性能提升
6. 深度洞察:信息的累加性
7. 总结与展望