MambaDSF:深海感知新突破,状态空间模型重塑声呐小目标检测

MambaDSF: Multi-Scale SSM with Dilated Feature Fusion for Sonar Small Target Detection

2026-01-01
Hui Lin, Jiayi Li, Jing Wang, Shenghui Rong
总结
问题
方法
结果
要点
摘要

本文提出了 MambaDSF,一种用于声呐图像小目标检测的混合状态空间模型(SSM)框架。该方法通过 MambaEFP 骨干网络、DFMamba 编码器以及专门设计的损失函数,在 UATD 基准测试中达到了 SOTA 性能(91.5% mAP50),显著提升了弱回波和复杂环境下的目标鲁棒性。

TL;DR

在水下探测领域,如何从充满了斑点噪声和伪影的声呐图中识别出仅占几个像素的小目标,一直是行业痛点。本文提出的 MambaDSF 巧妙地将最新的 Mamba (SSM) 架构与多尺度特征融合技术结合。它既保留了 CNN 捕获局部边缘的效率,又利用 Mamba 的线性时间复杂度实现了全局噪声建模,最终在多项声呐检测任务中刷新了 SOTA 记录。

1. 痛点:为什么声呐检测比视觉检测难?

声呐(Sonar)探测并非普通的“图像处理”,它面临着物理层面的极限挑战:

  • 极低对比度:目标的声学回波往往被背景混响淹没。
  • 特征稀疏:小目标在经过几层卷积下采样后,特征图上仅剩 1-2 个像素,极易丢失。
  • 尺度歧义 (Scale Ambiguity):随着成像距离和掠射角的变化,同一目标的表观尺寸会剧烈波动。

传统 CNN 虽然高效,但受限于感受野,无法区分局部的“假警报”噪声与真实的弱目标;而 Transformer 虽然能建全局模,但 的复杂度让嵌入式水下平台(如 AUV)难以承受。

2. 核心架构:MambaDSF 的三位一体方案

MambaDSF 的核心思想是利用 Selective State Space Models (SSM) 的门控机制。通过调整输入相关的 (步长),模型可以自适应地保留目标 Token 并抑制背景噪声 Token。

2.1 MambaEFP:局部与全局的“握手”

传统的视觉 Mamba 会将二维图像展平成一维序列,这会冲淡小目标的稀疏特征。作者设计了 Hybrid Block,在 Stage 3 加入并行分支:

  • 局部分支:使用深度可分离卷积(DW-Conv)保留细微的边缘。
  • 全局分支:利用 SSM 进行大规模背景建模。 两者通过学习到的残差权重动态融合,确保“既看得到树木,也看得到森林”。

模型架构图

2.2 DFMamba:解决尺度歧义的利器

为了应对目标尺寸的变化,DFMamba 编码器 引入了多尺度空洞注意力(MSDA)。它将特征通道拆分,通过不同的扩张率(Dilation Rate)提取特征,使得模型能同时识别“紧凑的边界”和“宽阔的回波包络”。

此外,通过 Selective Cross-scale Modulation (SCM),相邻金字塔层的特征被用于调制当前层的 SSM 参数,实现了跨尺度的语义对齐。

DFMamba 架构

3. 实验结果:小目标上的质变

在 UATD 基准测试中,MambaDSF 的表现非常抢眼:

  • 精度:mAP50 达到 91.5%,优于 RT-DETR 和 YOLOv8 等高性能算法。
  • 小目标专项:在极小目标子集上,提升幅度高达 +2.2 pp
  • 跨域能力:在完全未见过的 FLS 数据集上,该模型依然保持了极高的泛化性能,这归功于其对全局声学上下文的精准建模。

实验结果对比

4. 深度洞察:为何 SA-WIoU 如此重要?

在针对声呐小目标的训练中,预测框和真实高度框经常完全不重叠(IoU=0),导致梯度消失,模型收敛困难。 本文引入的 Scale-Adaptive Weighted IoU (SA-WIoU) 将边界框建模为二维高斯分布,计算 Wasserstein 距离。即使两者不重叠,也能产生连续梯度,引导模型逐步逼近目标。这种设计体现了算法对物理现实(目标极小且回波模糊)的深度关照。

5. 总结与局限

MambaDSF 成功验证了 SSM 架构在特种成像领域的优越性。它在参数量(28.7M)与性能之间取得了极佳的平衡。

局限性分析: 虽然其计算量是线性的,但在目前的实验中,FPS(47.5)仍略低于深度优化的 YOLO 家族。这主要是因为传统的 SSM 在通用 GPU 上的算子实现仍有提升空间。未来,针对 Mamba 算子的硬件级加速将是该方案在 AUV 实时部署的关键。

结语:这篇工作不仅是声呐检测领域的一次技术飞跃,也为在低质量图像、边缘计算任务中应用 SSM 提供了极有价值的范式参考。

发现相似论文

试试这些示例

  • 查找最近一年内将 Mamba 架构应用于水下成像或遥感目标检测的最新 SOTA 论文。
  • 哪篇论文最早探讨了感知尺寸随距离变化的尺度歧义问题,MambaDSF 的 DFMamba 模块是如何借鉴其思想的?
  • 针对极小目标检测,除了 SA-WIoU 外,还有哪些基于高斯分布或点监督的损失函数正在被主流研究采用?
目录
MambaDSF:深海感知新突破,状态空间模型重塑声呐小目标检测
1. TL;DR
2. 1. 痛点:为什么声呐检测比视觉检测难?
3. 2. 核心架构:MambaDSF 的三位一体方案
3.1. 2.1 MambaEFP:局部与全局的“握手”
3.2. 2.2 DFMamba:解决尺度歧义的利器
4. 3. 实验结果:小目标上的质变
5. 4. 深度洞察:为何 SA-WIoU 如此重要?
6. 5. 总结与局限