DACA-Net:退化感知条件扩散网络,重塑水下视觉的高保真度
DACA-Net: A Degradation-Aware Conditional Diffusion Network for Underwater Image Enhancement
本文提出了 DACA-Net,这是一种用于水下图像增强的退化感知条件扩散模型。该方法通过轻量级双流网络预测退化评分,并结合 Swin-UNet 架构、物理引导融合模块(PGFM)以及多重混合损失函数,实现了在多种水下环境下的 SOTA 增强性能。
TL;DR
在复杂的海洋环境中,由于光的非均匀吸收和散射,水下图像往往伴随着“蓝绿偏色”和“雾感朦胧”。传统的增强算法在面对不同深度的退化时显得力不从心。本文提出的 DACA-Net,通过引入一个轻量级的退化评估器来量化图像受损程度,并以此动态调节扩散模型(Diffusion Model)的去噪轨迹,实现了水下图像的精准修复。
背景定位:该工作是水下图像增强(UIE)领域结合条件扩散模型(Conditional Diffusion)与物理先验的代表性 SOTA 成果。
1. 痛点:为什么水下增强这么难?
现有的水下增强方法主要面临三大挑战:
- 物理模型的局限性:传统基于暗通道先验(DCP)的方法依赖于光照均匀等理想假设,在真实的海底杂乱环境中容易参数估计失效。
- 深度学习的泛化性:监督学习模型重度依赖人工合成数据,导致在面对真实的、未见过的水域场景时出现色调偏差或伪影。
- 扩散模型的刚性:标准扩散模型使用固定的噪声计划,无法根据图像具体受损的严重程度(如前景与远景的不同衰减)进行差异化处理。
2. 核心方案:退化感知的条件生成
DACA-Net 的核心在于将“退化程度”从一个模糊的概念变成了一个可量化、可引导的信号。
2.1 双流退化评估器 (Dual-Stream Estimator)
为了让模型知道“病得有多重”,作者设计了一个极其轻量级的双流网络。它输入原始图和参考图(训练阶段),学习回归出基于 PSNR 的归一化退化分数 。这个分数在推理阶段可以作为全局语义引导。
2.2Swins-UNet 与 AdaGN 模块
去噪网络采用了层次化的 Swin-UNet。为了让退化分数 真正发挥作用,作者引入了 AdaGN (Adaptive Group Normalization)。
通过该模块,模型可以根据退化程度 动态调整特征图的缩放和平移,从而实现自适应的去噪强度。
图 1: DACA-Net 总体架构,包含退化评估、AdaGN 注入及 Swin UNet 去噪骨干。
3. 物理引导融合模块 (PGFM)
为了解决水下最顽固的“红色消失”现象,PGFM 模块做了两件事:
- 红通道补偿:利用退化分数 学习一个扩增系数,主动补偿深度吸收最快的红光波段。
- 频率感知注意力:在傅里叶变换空间进行特征提取,这比传统空间卷积更能敏锐捕捉图像的细微结构和高频边缘。
4. 实验表现:SOTA 级别的视觉重建
在 UIEB 和 LSUI 等主流数据集上,DACA-Net 展现了统治级的性能。
4.1 量化指标
在 UIEB 测试集上,DACA-Net 的 PSNR 达到了 28.60 dB,对比之前的最强模型 GUPDM (28.19 dB) 提升显著。更重要的是,在不需要参考图的感知指标 UIQM 和 UCIQE 上,它也获得了最高分,说明增强结果非常符合人类视觉审美。
4.2 消融实验验证
实验数据表明:
- 只加 AdaGN,PSNR 从 23.72 升至 27.04。
- 同时集成 AdaGN 和 PGFM,PSNR 达到峰值 28.60。 这证明了退化感知引导与物理先验的结合是该模型成功的双引擎。
图 2: 在真实水下场景中的视觉对比。相比其他方法,DACA-Net(最后一列)的色彩还原最接近 Ground Truth,且没有过度锐化带来的伪影。
5. 总结与展望
DACA-Net 成功地通过“退化感知”解决了扩散模型在水下增强任务中灵活性不足的问题。
未来启示:
- 实时化潜力:尽管扩散模型推理通常较慢,但本工作通过 Swin-UNet 的高效实现将单帧推理压到了 3ms 左右,极具实时处理潜力。
- 盲增强进化:目前退化评估器在训练时仍需成对数据,未来结合无监督(Unsupervised)的退化估计将使该框架在未知深海探索中更具威力。
结论:如果你正在寻找一种既能保持物理一致性,又能兼顾生成模型高表现力的水下视觉方案,DACA-Net 是目前不可忽视的里程碑工作。
