[CVPR 2025? 预研] Selfment:彻底告别人工标注,全自监督分割实现 SOTA 跨越

Learning Accurate Segmentation Purely from Self-Supervision

总结
问题
方法
结果
要点
摘要

本文提出了 Selfment,一个全自监督的前景分割框架。该方法无需人工标注、预训练分割模型或后处理,通过结合 DINOv3 基础模型、归一化割(NCut)和创新的迭代增强技术,在多个基准测试中刷新了 SOTA 记录。

TL;DR

复旦大学的研究团队提出了一种名为 Selfment 的全自监督框架,实现了在完全不使用人工标签、不使用 SAM 等外部分割模型、甚至不使用后处理的情况下,精准分割图像前景。通过对 DINOv3 特征进行迭代特征优化 (IPO),该方法在显著性检测和伪装目标检测(COD)任务上均大幅刷新了无监督学习的纪录。

背景:无监督分割的“最后一步”

在计算机视觉领域,虽然自监督学习(SSL)在表征学习上取得了巨大成功,但精确分割始终难以摆脱人工标注的影子。现有的无监督方法,要么生成的掩码边缘像“锯齿”一样粗糙(如早期的 TokenCut),要么背后偷偷使用了预训练的分割先验(如 SAM)。

作者提出了一个终极挑战:能不能仅依靠图像本身的像素和自监督模型的原始特征,就学出媲美人类标准的分割能力?

核心动机 (Motivation)

作者发现,像 DINOv3 这样的视觉基础模型已经学习到了极强的**物体中心(Object-centric)**表征。同一物体的不同 Patch 在特征空间中天然聚集。然而,直接用传统的图割(NCut)方法会将这种连续的特征强行离散化,导致信息丢失和噪声。

为了解决这一痛点,科研人员设计了 IPO (Iterative Patch Optimization)。它的直觉非常像 K-Means,但它是在自监督特征的高维流形上运行,通过不断“校准”前景和背景的中心,让边界自动对齐特征的突变处。

方法论详解 (Methodology)

1. 初始分割:利用图论寻找“谱”

首先,Selfment 将图像看作一个图,Patch 为节点,特征相似度为边权。通过解广义特征值问题(NCut),获取第二小特征向量(Fiedler Vector),得到一个初步但包含语义的粗略掩码。

2. 核心大招:迭代特征优化 (IPO)

这是本文的核心贡献。给定初始掩码,模型在特征空间执行以下循环:

  • 聚类更新:计算当前前景和背景 patch 的平均特征向量(类中心)。
  • 重新分配:每个 patch 根据与类中心的余弦相似度,重新投票决定归属。
  • 方向约束:为了防止在迭代中前景背景“互换”,引入了方向一致性过滤。

3. 自监督训练闭环

优化后的掩码虽然已经很强,但作者更进一步。他们将这些掩码作为“伪标签”,训练一个极简的投影头。通过 Contrastive Loss(拉近同类 patch,推开异类)和 Dice Loss,模型学会了更加稳健的、具有判别性的物体边界。

模型架构图 图 2: Selfment 整体流水线:从原始图像到 NCut 初始化,再到 IPO 优化与自监督训练。

实验战绩 (Experiments)

1. 显著性检测:降维打击

在 ECSSD 和 DUTS 等经典数据集上,Selfment 不仅超过了之前的无监督方法,而且是在**不加任何后处理(如 CRF)**的情况下实现的。

  • ECSSD: Fmax 达到 95.9% (相比前作 +4.0%)
  • PASCAL-S: Fmax 达到 91.7% (+5.7%)

2. 零样本泛化:挑战伪装目标 (COD)

最令人惊讶的结果发生在伪装目标检测任务中。在物体几乎与背景融为一体的情况下,Selfment 依然能精准“抠图”,甚至在某些指标上击败了使用大量人工标注训练的全监督模型(如 FSPNet)。

实验结果对比 图 3: 定性对比图。可以看到,即便在复杂背景下,Selfment 生成的显著图也比前作更加完整且精细。

深度洞察:为什么它比前人强?

  1. 分级优化:不同于以往方法的一步到位,IPO 给了模型“反思”的机会。通过 20 次迭代,噪声被逐渐过滤,空间连贯性自发产生。
  2. 分辨率鲁棒性:实验证明,以往的方法(如 TokenCut)在高分辨率下会因为图连接过于复杂而崩溃。但 Selfment 展现了“遇强则强”的特性,输入分辨率越高(如 2560x2560),细节抓取越精准。
  3. 计算资源极致利用:尽管使用了巨大的 DINOv3-7B,但训练过程只需冻结权重,训练轻量级头部仅需不到 30 分钟。

局限性与展望

正如文中所述(图 9),当背景中存在与前景语义高度相似的物体(如同属一类的干扰项)时,Selfment 会产生误判。这说明仅凭单图的特征相似度仍有天花板。未来的方向可能在于引入跨图像的语义协同或时序约束。

总结

Selfment 的出现标志着全自监督分割已经跨越了“娱乐级”性能,正式步入“实用级”殿堂。它告诉我们:视觉大模型的潜力还远未被完全挖掘,只要有合适的优化机制(如 IPO),我们完全可以从乱序的特征中梳理出极其精确的世界结构。

发现相似论文

试试这些示例

  • 查找最近其他利用 DINOv2 或 DINOv3 特征进行无监督目标发现(Object Discovery)的论文。
  • 哪篇论文最早将 Normalized Cut (NCut) 应用于深度学习特征图的分割,本文的 IPO 优化与其相比有何数学直觉上的改进?
  • 探讨将 Selfment 的自监督分割架构扩展到视频序列(Video Object Segmentation)或多模态任务中的研究现状。
目录
[CVPR 2025? 预研] Selfment:彻底告别人工标注,全自监督分割实现 SOTA 跨越
1. TL;DR
2. 背景:无监督分割的“最后一步”
3. 核心动机 (Motivation)
4. 方法论详解 (Methodology)
4.1. 1. 初始分割:利用图论寻找“谱”
4.2. 2. 核心大招:迭代特征优化 (IPO)
4.3. 3. 自监督训练闭环
5. 实验战绩 (Experiments)
5.1. 1. 显著性检测:降维打击
5.2. 2. 零样本泛化:挑战伪装目标 (COD)
6. 深度洞察:为什么它比前人强?
7. 局限性与展望
8. 总结