[CVPR 2026] 3D-RFT:当强化学习遇上 3D 视频理解,4B 模型如何逆袭 8B 巨人?
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
总结
问题
方法
结果
要点
摘要
本文提出了 3D-RFT,这是首个将可验证奖励强化学习(RLVR)引入视频 3D 场景理解的框架。该方法通过 GRPO 算法直接优化 3D IoU、F1-Score 和精度等指标,使 4B 规模的模型在 3D 检测、视觉定位和空间推理任务上超越了 8B 规模的 SOTA 基线。
TL;DR
传统的 3D 视觉模型通常被困在“模仿老师”的 SFT 范式中,却忽略了感知任务真正的评价标准。本文提出的 3D-RFT 首次将 Reinforcement Learning with Verifiable Rewards (RLVR) 引入视频 3D 场景理解。通过直接优化 3D IoU 和 F1-Score 等物理指标,3D-RFT-4B 在多项基准测试中超越了尺寸大一倍的 SOTA 模型,彻底打破了 SFT 的性能天花板。
1. 痛点:被误解的“优化目标”
在 3D 视频检测或定位任务中,模型输出的是一串代表三维坐标的文本(Token)。
- SFT 的局限:SFT 使用交叉熵损失(Cross-Entropy Loss),只要预测的 Token 和 Ground-Truth 接近,损失就低。但 3D 任务的本质是几何精确度。一个 Token 的微小变化在 3D 空间可能导致巨大的 IoU 损失。
- 目标失配 (Misalignment):训练是在优化“猜字概率”,而测试是在评估“空间重叠”。这种“牛头不对马嘴”的代理优化目标限制了模型的上限。
2. 核心机制:指标即奖励 (Metrics-Driven Optimization)
3D-RFT 借鉴了 DeepSeek-R1 等推理模型的思路,引入了可验证奖励 Reinforcement Learning。
2.1 训练流程
- SFT Warm-Up:先让模型学会基本的 3D 概念和输出格式(如使用
<think>和<answer>标签)。 - RL Training (GRPO):利用组相对策略优化。模型对同一个视频生成多组答案,根据最终的 3D 解析指标(Reward)来决定哪些行为该奖励,哪些该惩罚。
2.2 可验证奖励函数设计
- 对于 3D 检测:奖励 = 平均 3D IoU + F1-Score。这强迫模型不仅要框得准,还要查得全。
- 对于空间推理:奖励由多选准确率或数值回归精度决定。

3. 实验战绩:极致的效率提升
在 ScanNetDetection 和 ScanRefer 上的表现令人惊叹。
- 以小博大:3D-RFT-4B 在多项指标上击败了拥有 8B 参数的 VG LLM。在 3D 视频检测任务中,Precision 狂飙 +12.5%。
- 几何精度进化:定性分析显示,3D-RFT 训练出的模型生成的 Bounding Box 更加紧凑且准确,显著减少了 SFT 模型中常见的“幻觉”物体。

4. 深度洞察:为什么有效?
论文不仅给出了结果,还揭示了训练背后的动力学:
- 从“对齐”到“极致”:在检测任务中,IoU 奖励在前期迅速上升(模型在对齐几何位置),而 F1 奖励在中后期持续增长(模型在精细化目标识别)。
- 数据质量决定上限:作者发现,即使是少量的、由更强模型(如 Qwen3-VL-32B)生成的思考链(CoT)数据,也能显著增强 RFT 的效果。没有这种“思考”过程,RL 很容易陷入局部最优。
5. 局限与未来
尽管 3D-RFT 表现强劲,但目前的 RL 训练仍然是任务特定的。如何平衡多任务奖励,实现一个通用的 3D 强化学习大模型,将是下一步的竞争焦点。此外,针对感知过程本身的“中间奖励(Process Reward)”设计,也将是提升推理可靠性的关键。
总结: 3D-RFT 标志着 3D 场景理解从“单纯模仿”向“结果导向”的重大转变。它告诉我们,与其给模型提供更多的 SFT 数据,不如给它一个精准的测量尺,让它在强化学习的探索中自我进化。
