[AMD 2026] DC-DiT:打破固定 Patch 限制,扩散 Transformer 的内容自适应革命
Dynamic Chunking Diffusion Transformer
本文提出了 Dynamic Chunking Diffusion Transformer (DC-DiT),一种采用端到端学习的动态分块机制的新型扩散 Transformer 架构。该方法通过一个 Encoder-Router-Decoder 结构,实现了根据图像内容复杂度及扩散时间步(Timestep)自适应调整 token 序列长度,在 ImageNet 256x256 任务上刷新了同等计算量下的 SOTA 性能。
TL;DR
传统的 Diffusion Transformer (DiT) 就像一个死板的画家,无论画背景还是画眼睛都用同样细的笔触。AMD 研究团队提出的 DC-DiT (Dynamic Chunking Diffusion Transformer) 彻底改变了这一点。它采用一种可学习的动态分块机制,让模型自动学会:在无聊的背景和嘈杂的扩散早期使用极少的 Token,而在细节丰富的物体和去噪后期增加计算投入。这不仅提升了推理速度,更在 FID 指标上显著超越了传统的固定 Patch 方案。
核心速览
- 核心痛点:DiT 固定的分块操作对所有区域和时间步一视同仁,计算资源分配效率低下。
- 创新方案:引入带路由机制的 Encoder-Router-Decoder 支架,实现端到端的 Token 动态压缩与恢复。
- 关键成果:在 ImageNet 256×256 上,DC-DiT 在多个尺度下(B/XL)均优于参数匹配和 FLOPs 匹配的 Baseline,并支持从预训练 DiT “无损升级”(Upcycling)。
痛点深挖:为什么固定的 Patch 会限制扩散模型?
目前的扩散模型(如 Sora, DiT)大多将图像切成固定大小的 Patch(如 2x2 或 4x4)。这种设计存在两个自然的直觉缺失:
- 空间冗余:蓝天和复杂的纹理在 Token 数量上竟然是平等的,这显然不符合计算效率。
- 时间阶段性:扩散的早期(高噪声阶段)主要生成轮廓,并不需要极细的 Token 分辨率;只有到了后期细节填充时,精细采样才有意义。
方法论详解:DC-DiT 的动态引擎
DC-DiT 的核心是为 DiT 穿上了一层“自适应外壳”。
1. 动态分块架构 (Overview Architecture)
DC-DiT 并没有改变内部的 Transformer Blocks,而是在其外层包裹了:
- Encoder:聚合邻近 Token 的上下文信息,为路由做准备。
- Router (Chunking Layer):根据相似度决定哪些 Token 是“边界”(保留),哪些是“非边界”(丢弃)。
- Inner DiT:在一个被大幅压缩的短序列上进行高性能去噪。
- De-chunking & Decoder:通过空间平滑(Spatial Smoothing)和插值,将短序列还原回原始分辨率。

2. 空间感知的路由逻辑
为了让 Router 在 2D 空间工作,作者设计了一个巧妙的相似度度量(Similarity Score)。通过 3x3 的深度卷积计算邻域 Token 的平均相似度,如果当前 Token 与周围很像(相似度高),边界概率 就低,该 Token 就会被合并。
3. 时间步自适应
最令人惊喜的是,这种压缩是随时间动态变化的。由于路由概率是通过扩散时间步 条件化的,模型学会了在 较大(噪声大)时激进压缩序列长度,从而显著节省推理预算。
实验与结果:全方位的性能碾压
SOTA 对比
在 class-conditional ImageNet 256×256 任务中,DC-DiT 表现极其抢眼。在 XL 规模下,即使压缩率高达 16x,DC-DiT 的 FID (13.60) 依然远好于同等算力的传统 DiT (16.35)。

自发涌现的图像分割
研究发现,虽然没有给模型任何分割标签,但 Router 自动学会了识别物体边缘。如下图所示,红点(保留的 Token)精准地捕捉到了物体的轮廓和复杂纹理,而背景区域则被大面积压缩。

Upcycling 与蒸馏
为了让现有的预训练模型不至于浪费,DC-DiT 方案支持 Upcycling。通过短短 50K 步的“激活蒸馏”(Activation Distillation),不到 15% 的训练成本就能让已有模型具备动态计算能力,且效果优于从头训练。
深度洞察与总结
为什么 DC-DiT 有效?
- 更有意义的注意力:通过剔除冗余 Token,Transformer 的 Attention 机制能更集中地学习复杂区域的交互。
- 多尺度归纳偏置:这种架构在无形中引入了类似金字塔结构的视觉特征处理方式,但比传统金字塔更灵活(按需分配)。
局限性与未来
尽管性能强大,但 DC-DiT 在实现时需要处理变长的 Token Batch,这对于现有的部分硬件加速框架仍有优化空间。此外,虽然在图片生成上效果卓著,但其在视频生成(需处理 3D Token 块)中的一致性还有待进一步验证。
Takeaway: DC-DiT 告诉我们,未来的 AI 模型不应该是静态的计算图,而应该是能根据输入数据的“疏密”和推理阶段的“难易”来自发调整形状的自适应实体。
