[CVPR 2025? 预研] Selfment:彻底告别人工标注,全自监督分割实现 SOTA 跨越
Learning Accurate Segmentation Purely from Self-Supervision
本文提出了 Selfment,一个全自监督的前景分割框架。该方法无需人工标注、预训练分割模型或后处理,通过结合 DINOv3 基础模型、归一化割(NCut)和创新的迭代增强技术,在多个基准测试中刷新了 SOTA 记录。
TL;DR
复旦大学的研究团队提出了一种名为 Selfment 的全自监督框架,实现了在完全不使用人工标签、不使用 SAM 等外部分割模型、甚至不使用后处理的情况下,精准分割图像前景。通过对 DINOv3 特征进行迭代特征优化 (IPO),该方法在显著性检测和伪装目标检测(COD)任务上均大幅刷新了无监督学习的纪录。
背景:无监督分割的“最后一步”
在计算机视觉领域,虽然自监督学习(SSL)在表征学习上取得了巨大成功,但精确分割始终难以摆脱人工标注的影子。现有的无监督方法,要么生成的掩码边缘像“锯齿”一样粗糙(如早期的 TokenCut),要么背后偷偷使用了预训练的分割先验(如 SAM)。
作者提出了一个终极挑战:能不能仅依靠图像本身的像素和自监督模型的原始特征,就学出媲美人类标准的分割能力?
核心动机 (Motivation)
作者发现,像 DINOv3 这样的视觉基础模型已经学习到了极强的**物体中心(Object-centric)**表征。同一物体的不同 Patch 在特征空间中天然聚集。然而,直接用传统的图割(NCut)方法会将这种连续的特征强行离散化,导致信息丢失和噪声。
为了解决这一痛点,科研人员设计了 IPO (Iterative Patch Optimization)。它的直觉非常像 K-Means,但它是在自监督特征的高维流形上运行,通过不断“校准”前景和背景的中心,让边界自动对齐特征的突变处。
方法论详解 (Methodology)
1. 初始分割:利用图论寻找“谱”
首先,Selfment 将图像看作一个图,Patch 为节点,特征相似度为边权。通过解广义特征值问题(NCut),获取第二小特征向量(Fiedler Vector),得到一个初步但包含语义的粗略掩码。
2. 核心大招:迭代特征优化 (IPO)
这是本文的核心贡献。给定初始掩码,模型在特征空间执行以下循环:
- 聚类更新:计算当前前景和背景 patch 的平均特征向量(类中心)。
- 重新分配:每个 patch 根据与类中心的余弦相似度,重新投票决定归属。
- 方向约束:为了防止在迭代中前景背景“互换”,引入了方向一致性过滤。
3. 自监督训练闭环
优化后的掩码虽然已经很强,但作者更进一步。他们将这些掩码作为“伪标签”,训练一个极简的投影头。通过 Contrastive Loss(拉近同类 patch,推开异类)和 Dice Loss,模型学会了更加稳健的、具有判别性的物体边界。
图 2: Selfment 整体流水线:从原始图像到 NCut 初始化,再到 IPO 优化与自监督训练。
实验战绩 (Experiments)
1. 显著性检测:降维打击
在 ECSSD 和 DUTS 等经典数据集上,Selfment 不仅超过了之前的无监督方法,而且是在**不加任何后处理(如 CRF)**的情况下实现的。
- ECSSD: Fmax 达到 95.9% (相比前作 +4.0%)
- PASCAL-S: Fmax 达到 91.7% (+5.7%)
2. 零样本泛化:挑战伪装目标 (COD)
最令人惊讶的结果发生在伪装目标检测任务中。在物体几乎与背景融为一体的情况下,Selfment 依然能精准“抠图”,甚至在某些指标上击败了使用大量人工标注训练的全监督模型(如 FSPNet)。
图 3: 定性对比图。可以看到,即便在复杂背景下,Selfment 生成的显著图也比前作更加完整且精细。
深度洞察:为什么它比前人强?
- 分级优化:不同于以往方法的一步到位,IPO 给了模型“反思”的机会。通过 20 次迭代,噪声被逐渐过滤,空间连贯性自发产生。
- 分辨率鲁棒性:实验证明,以往的方法(如 TokenCut)在高分辨率下会因为图连接过于复杂而崩溃。但 Selfment 展现了“遇强则强”的特性,输入分辨率越高(如 2560x2560),细节抓取越精准。
- 计算资源极致利用:尽管使用了巨大的 DINOv3-7B,但训练过程只需冻结权重,训练轻量级头部仅需不到 30 分钟。
局限性与展望
正如文中所述(图 9),当背景中存在与前景语义高度相似的物体(如同属一类的干扰项)时,Selfment 会产生误判。这说明仅凭单图的特征相似度仍有天花板。未来的方向可能在于引入跨图像的语义协同或时序约束。
总结
Selfment 的出现标志着全自监督分割已经跨越了“娱乐级”性能,正式步入“实用级”殿堂。它告诉我们:视觉大模型的潜力还远未被完全挖掘,只要有合适的优化机制(如 IPO),我们完全可以从乱序的特征中梳理出极其精确的世界结构。
