Seg-Zero:当强化学习遇见图像分割,推理能力的“零样本”涌现

Seg-zero: Reasoning-chain guided segmentation via cognitive reinforcement

2025-01-01
Yuqi Liu, Bohao Peng, Zhisheng Zhong, Zihao Yue, Fanbin Lu, Bei Yu, Jiaya Jia
总结
问题
方法
结果
要点
摘要

本文提出了 Seg-Zero,一种由认知强化驱动的推理分割(Reasoning Segmentation)框架。该框架将推理模型与分割模型解耦,通过纯强化学习(Reward-driven RL)激活了多模态大模型的思维链(CoT)推理能力,在 ReasonSeg 零样本(Zero-shot)测试中比 LISA-7B 提升了 18%。

TL;DR

推理分割(Reasoning Segmentation)要求模型不仅能看清物体,还要能“理解”复杂的指令。传统的监督微调(SFT)虽然有效,但容易让模型变“傻”(遗忘通用能力)且泛化性差。近日,来自香港中文大学和贾佳亚团队的研究者提出了 Seg-Zero,通过纯强化学习(RL)激活了模型的思维链(CoT)推理,不仅在零样本性能上碾压前作,更让视觉分割具备了类似 OpenAI o1 的思考过程。


痛点深挖:为什么 SFT 不是最优解?

在 Reasoning Segmentation 任务中,我们经常会遇到这样的指令:“请分割出图中能提供持续能量的食物”。这需要模型经历:识别物体 -> 检索知识(哪些食物提供慢消化碳水)-> 指令对齐 -> 精确分割。

以往的做法(如 LISA)是喂给模型大量的“指令-掩码”对进行微调。但作者发现,这种 SFT 范式存在两个致命缺陷:

  1. 由于过度拟合训练集,模型在面对未见过(OOD)的复杂推理场景时,性能会断崖式下跌。
  2. 微调过程中,LLM 原有的强大视觉问答(VQA)能力会因为参数偏移而迅速衰减(灾难性遗忘)。

方法论详解:解耦架构与认知强化

Seg-Zero 并没有试图在一个模型里解决所有问题,而是采用了推理模型 + 分割模型的解耦方案。

1. 架构解析

  • 推理模型 (Reasoning Model):基于 Qwen2.5-VL。通过强化学习,它学会了先在 <think> 标签内进行自我纠错和逻辑推导,最后输出目标的 Bounding Box (Bbox) 以及两个关键采样点 (Points)。
  • 分割模型 (Segmentation Model):使用冻结的 SAM2。它只负责执行,接收来自推理模型的几何 Prompt,生成高精度的像素掩码。

模型架构图 图注:Seg-Zero 的双阶段设计,将复杂的逻辑推导交给了 MLLM,而将精细的像素操作留给成熟的专家模型。

2. 纯 RL 驱动的“自进化”

Seg-Zero 最大的亮点在于其训练不依赖任何标注好的推理过程数据。通过 GRPO (Group Relative Policy Optimization) 算法,团队设计了一套精密的奖励机制:

  • 格式奖励:强迫模型必须输出由 <think><answer> 包裹的内容。
  • 精度奖励:根据预测的 Bbox 与真实标签的 IoU 分数、L1 距离来打分。

这种“胡萝卜加大棒”的机制,强制模型在没有任何模板参考的情况下,自发学会了如何拆解复杂问题。


实验与结果:全方位的跨越

实验结果显示,Seg-Zero 在多个维度上展现了压倒性优势。

1. SOTA 性能对比

在 ReasonSeg 这一专门测试推理分割的基准上,Seg-Zero-7B 实现了 57.5 gIoU,远超之前的标杆 LISA-7B。即便与 13B 规模的模型相比,它也展现出了极强的竞争力。

性能对比图

2. SFT vs RL 的本质区别

通过消融实验(Ablation Study),可以看到 SFT 模型在测试 OOD 数据时性能下降明显,而 RL 模型不仅在分割精度上持续提升,还完美保留了 VQA 能力。

推理长度变化 图注:随着训练步数的增加,模型的 Thinking(推理)长度逐渐增加,这证明了模型正在学习如何通过更深入的思考来获得更高奖励。


深度洞察:为什么推理链对分割很重要?

在定性分析中(见下图),当用户问“在公路上行驶且适合睡觉的车”时,Seg-Zero 会在推理链中分析:“房车(RV)有可见的床位,而卡车主要用于货运”。 这种显式化语义冲突消解的能力,是传统端到端分割模型通过像素回归极难习得的。

定性实验结果


总结与局限性

Seg-Zero 的成功标志着视觉推理进入了“系统 2”时代——即从直觉式的快速响应转向有思考过程的慢思考。

  • Takeaway: 通过纯 RL 唤醒 MLLM 的推理能力,是解决感知任务复杂泛化问题的有效路径。
  • 局限性: 目前 Seg-Zero 主要针对单目标推理。对于多目标、实例级推理分割,系统复杂度和奖励设计将面临更大挑战。这正是该领域下一个激动人心的前沿。

发现相似论文

试试这些示例

  • 查找最近除了 Seg-Zero 以外,利用 DeepSeek-R1 提出的 GRPO 算法优化多模态感知任务的其他研究论文。
  • 哪篇论文首次提出了将 MLLM 产生的特殊 Token(如 LISA 的 SEG Token)与分割模型对接?本文的解耦架构对此做了哪些本质改进?
  • 目前有哪些研究在尝试将这种“思维链引导的推理”扩展到多目标分割或视频实例分割(Video Instance Segmentation)任务中?
目录
Seg-Zero:当强化学习遇见图像分割,推理能力的“零样本”涌现
1. TL;DR
2. 痛点深挖:为什么 SFT 不是最优解?
3. 方法论详解:解耦架构与认知强化
3.1. 1. 架构解析
3.2. 2. 纯 RL 驱动的“自进化”
4. 实验与结果:全方位的跨越
4.1. 1. SOTA 性能对比
4.2. 2. SFT vs RL 的本质区别
5. 深度洞察:为什么推理链对分割很重要?
6. 总结与局限性