[CVPR 2026] 复兴 ConvNeXt:全卷积扩散模型 FCDM 开启高效生成新纪元

Reviving ConvNeXt for Efficient Convolutional Diffusion Models

总结
问题
方法
结果
要点
摘要

本文提出了全卷积扩散模型 (FCDM),通过复兴 ConvNeXt 架构并引入条件注入,构建了一个高效的视觉生成主干网络。在 ImageNet 512x512 任务上,FCDM-XL 仅需 DiT 50% 的 FLOPs,并以 7.5 倍的训练速度提升达到了相当的 SOTA 生成质量。

TL;DR

在 Transformer 架构统治生成式 AI 的今天,全卷积网络(ConvNets)是否已经过时?本文介绍的 Fully Convolutional Diffusion Model (FCDM) 给出了一记响亮的回答:卷积不仅没过时,而且比 Transformer 更快、更强、更省钱。FCDM 正式复兴了 ConvNeXt 架构,在仅消耗同级别 DiT 模型 50% FLOPs 的前提下,不仅生成质量(FID)全面胜出,训练速度更是快了 7.5 倍

背景定位:卷积真的不如 Transformer 能跑吗?

自 DiT (Diffusion Transformer) 出现以来,工业界普遍认为要提升扩散模型的生成效果,就必须走底层架构 Transformer 化的道路。然而,Transformer 的二次方复杂度带来的计算开销和内存墙(Memory Wall)让中小规模的实验室望而生畏。

作者敏锐地发现,现代卷积架构的三个核心优势:Locality Bias (局部归纳偏置)Parameter Efficiency (参数效率)Hardware Friendliness (硬件友好度) 在生成领域被严重低估了。

核心动机:解决 Transformer 的“资源依赖症”

  1. 计算冗余:Transformer 在处理图像这类具有高度空间局部性的数据时,全局注意力机制存在大量无效计算。
  2. 扩展性 vs 效率:虽然 DiT 易于 Scaling,但其推理和训练的 Throughput(吞吐量)在高分辨率下迅速崩塌。
  3. 卷积主干的缺失:早期的卷积扩散模型多为混合架构(Hybrid),缺乏一个像 ConvNeXt 那样纯粹且现代的卷积 Baseline。

架构解析:如何将 ConvNeXt 变成生成利器?

FCDM 的核心在于将分类任务中的 ConvNeXt 模块进行“生成式适配”。其架构设计遵循三个原则:

1. 现代卷积块重构 (FCDM Block)

保留了原版 ConvNeXt 的 7x7 深度切分卷积 (Depth-wise Conv) 以获得大感受野,但将层归一化替换为 Adaptive LayerNorm (AdaLN),用于注入时间步(Time Step)和类别(Class)信息。

2. 条件注入与反转瓶颈 (Inverted Bottleneck)

相比于竞争对手 DiCo,FCDM 采用了 ConvNeXt 的反转瓶颈结构。其逻辑直觉在于:先在低开销下进行空间卷积,再在高维空间进行通道计算。 这种顺序调换让模型在不增加开销的情况下获得了更丰富的特征表达能力。

3. 全局响应归一化 (GRN) 的物理直觉

FCDM 引入了 GRN 层。作者发现扩散模型中经常出现“通道坍缩”现象(特征分布散乱且存在冗余)。GRN 通过类似生物竞争的机制,通过 L2 范数对比增强了特征的对比度和通道多样性,且几乎不增加学习参数。

模型架构图 图 1: FCDM 的整体 U 型架构与基于 AdaLN 的条件注入机制

实验战绩:全速碾压

在 ImageNet 基准测试中,FCDM 展示了令人惊讶的性能曲线:

  • 效率对比:FCDM-XL 在 256x256 分辨率下的吞吐量是 272.7 it/s,而 DiT-XL/2 仅为 80.5 it/s。
  • 收敛速度:FCDM-XL 在训练 100 万步时的表现,需要 DiT-XL 训练近 750 万步才能对齐。
  • 低成本训练:以往训练一个 XL 级别的模型需要数十张 A100,而 FCDM-XL 可以在 4 张 RTX 4090 上稳定跑通,这对于初创团队和高校实验室而言是极大的利好。

实验结果对比 表 1: FCDM 在所有规模上均以更低的 FLOPs 实现了更优的 FID 指标

深度洞察:为什么卷积在生成任务中赢了?

论文提供了一个非常有趣的频域分析 (Frequency-domain Analysis)。通过对预测噪声的频谱分析发现,FCDM 在整个扩散过程中保留了比 DiT 更高的频谱能量 (Spectral Energy)

这说明了卷积的 Locality 偏置能够帮助模型更好地捕捉和恢复高频细节(如纹理、边缘),而 Transformer 会在中间步中表现出更强的高频平滑效应(Smoothing Effect)。这也解释了为什么卷积生成的图像在视觉观感上往往更加“锋利”。

局限性与展望

尽管 FCDM 在 ImageNet 上表现卓越,但作者也客观指出,全卷积架构在处理极长程依赖(极远距离像素的相关性)时,理论上限可能仍低于 Transformer。此外,在大规模文本-图像交叉注意力(Text-Image Cross-Attention)方面,FCDM 仍属于初步尝试,未来的突破口在于如何将卷积的高效性与线性注意力机制(Linear Attention)进行深层次融合。

总结

FCDM 不仅仅是一个新的 Baseline,它标志着现代卷积设计在生成领域的全面回归。它告诉我们,与其盲目堆砌计算量极大的全注意力模块,不如回归物理直觉,利用卷积的归纳偏置去构建更高效、更普及的 AI 基础设施。

发现相似论文

试试这些示例

  • 查找其他将 ConvNeXt 或现代卷积架构应用于 Stable Diffusion 等大规模文本生成图像任务的最新论文。
  • 追溯 ConvNeXt V2 (GRN) 设计的来源,并分析其在降低扩散模型特征通道冗余方面的数学直觉。
  • 探讨除了归一化层注入外,还有哪些研究在尝试将全卷积网络与 Cross-Attention 结合以提升多模态生成效率?
目录
[CVPR 2026] 复兴 ConvNeXt:全卷积扩散模型 FCDM 开启高效生成新纪元
1. TL;DR
2. 背景定位:卷积真的不如 Transformer 能跑吗?
3. 核心动机:解决 Transformer 的“资源依赖症”
4. 架构解析:如何将 ConvNeXt 变成生成利器?
4.1. 1. 现代卷积块重构 (FCDM Block)
4.2. 2. 条件注入与反转瓶颈 (Inverted Bottleneck)
4.3. 3. 全局响应归一化 (GRN) 的物理直觉
5. 实验战绩:全速碾压
6. 深度洞察:为什么卷积在生成任务中赢了?
7. 局限性与展望
8. 总结