[CVPR 2025(?)] 重新思考相机选择:机器人操作中鱼眼相机特性的深度实证研究

Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation

总结
问题
方法
结果
要点
摘要

本文提出了首个针对机器人操作中腕置 Fisheye (鱼眼) 相机的系统性实证研究,涵盖了空间定位、场景泛化和硬件泛化三大维度。研究表明,Fisheye 的超大 Field of View (FoV) 能显著提升策略性能,并结合提出的 Random Scale Augmentation (RSA) 解决了跨相机硬件泛化的难题。

TL;DR

在机器人操作领域,相机就是机器人的“眼睛”。长期以来,标准 Pinhole 相机是默认配置,但近期 UMI、π0 等顶尖工作纷纷转向 Fisheye (鱼眼) 相机。本文通过严谨的消融实验证明:鱼眼相机的超广角(Field of View)不仅能显著增强机器人的空间定位能力,还能在多样化场景下提供更强的泛化潜力。此外,针对鱼眼镜头畸变带来的硬件迁移难题,作者提出的 Random Scale Augmentation (RSA) 策略成为了跨设备部署的关键。


1. 痛点:为什么我们以前不敢大规模用鱼眼相机?

尽管鱼眼相机在无人驾驶和 SLAM 领域大放异彩,但在精度要求极高的机器人操作(Manipulation)中,开发者一直顾虑重重:

  1. 畸变困扰:严重的径向畸变会扭曲物体的几何形状。
  2. 定位疑虑:在近距离操作时,鱼眼边缘的分辨率损失是否会降低定位精度?
  3. 硬件锁定:为 A 相机采集的数据,换成畸变参数不同的 B 相机,策略是否会瞬间崩溃?

本文的动机正是要解开这些疑惑,为大规模 Fisheye 数据集采集提供理论指导。


2. 核心实验:鱼眼相机的三大超能力

RQ1:空间定位(Spatial Localization)

直觉:广角镜头能看到更多的背景特征点,就像在黑暗中抓住了更多的“扶手”。 发现:在背景纹理丰富的环境下(Feature-rich),鱼眼相机的定位误差(Trans. Err)显著低于针孔相机(2.36cm vs 5.37cm)。但如果背景是纯色的(Feature-poor),鱼眼的优势会大幅缩减。 启示:数据采集背景越乱越好,这样鱼眼才能完整发挥其“空间锚点”的作用。

模型架构与渲染流程 图 1:作者在 MuJoCo 中实现的双阶段 Fisheye 模拟流程

RQ2:场景泛化(Scene Generalization)

发现:鱼眼策略具有更强的“缩放效应”。随着训练场景数量(N)的增加,鱼眼策略在完全陌生的环境中的 Zero-shot 成功率提升曲线远比针孔相机陡峭。在 8 个场景训练后,真实世界的抓取成功率直接飙升至 95% 以上。

RQ3:硬件泛化(Hardware Generalization)

这是全篇最硬核的部分。当相机参数(Intrinsics)改变时,由于物体在画面中的绝对像素尺寸发生了变化,传统策略会产生严重的“深度错觉”。


3. RSA:破解硬件迁移的“灵丹妙药”

作者发现,模型失效的本质是 Scale Overfitting (尺度过拟合)。如果物体变大了,模型会以为它变近了,导致抓取深度过浅(Undershooting)。

为了打破这种依赖,作者提出了 Random Scale Augmentation (RSA)

  • 做法:在训练阶段,不使用固定比例裁切,而是从 中随机采样缩放因子。
  • 逻辑:如果缩放因子 > 1.0,则进行“缩小”并补黑边。
  • 效果:强制模型学习“物体相对于夹持器的大小”这种相对关系,而非像素绝对值。

RSA 策略示意图 图 2:RSA 增强与普通 Random Crop 的对比


4. 实验战绩

在多项任务(如 Pick Cup, Fold Towel, Hang Chinese Knot)中,Fisheye + RSA 的组合展现了统治级的性能:

  • 跨镜头迁移:在从 180° 镜头切换到 150° 或 220° 镜头时,普通策略得分几乎清零,而经过 RSA 加持的策略依然能稳定在 0.6-0.95。
  • 消融实验:即便移除机械臂的本体觉(Proprioception)输入,鱼眼相机仅凭视觉信息就能维持极高的操作精度,进一步证明了其隐含的空间建模能力。

实验结果对比 表 1:仿真任务中不同相机配置的成功率对比


5. 总结与行业启示

这篇论文为具身智能(Embodied AI)的数据采集标准定下了基调:

  1. 勇敢拥抱鱼眼镜头:它是低成本提升鲁棒性的最佳方案。
  2. 背景复杂度是资产:没必要在干净的实验室采集数据,真实世界的复杂纹理是鱼眼相机的最佳配角。
  3. RSA 必选:如果你希望你的数据集能被其他实验室的机器人复用,这种简单的尺度增强必不可少。

局限性:虽然解决了尺度泛化,但不同鱼眼镜头的非线性畸变模式(如等距 vs 等立体角)仍存在细微差异,未来的工作可能需要更复杂的几何对齐。


作者简介:本文由上海交通大学、东南大学和中科院团队联合发布,相关代码与视频已在 robo-fisheye.github.io 开源。

发现相似论文

试试这些示例

  • 查找最近一年内利用大规模鱼眼相机数据集训练的机器人通用大模型(如 π0 或 RDT)的相关评价与性能对比。
  • 哪篇论文最早探讨了机器人操作中视觉策略对绝对尺度的过拟合问题,本文提出的 RSA 与之前的尺度增强方法有何本质区别?
  • 目前有哪些主流的机器人物理引擎(除了本文改进的 MuJoCo)原生支持 Fisheye 渲染,其畸变模型的实现方式有何异同?
目录
[CVPR 2025(?)] 重新思考相机选择:机器人操作中鱼眼相机特性的深度实证研究
1. TL;DR
2. 1. 痛点:为什么我们以前不敢大规模用鱼眼相机?
3. 2. 核心实验:鱼眼相机的三大超能力
3.1. RQ1:空间定位(Spatial Localization)
3.2. RQ2:场景泛化(Scene Generalization)
3.3. RQ3:硬件泛化(Hardware Generalization)
4. 3. RSA:破解硬件迁移的“灵丹妙药”
5. 4. 实验战绩
6. 5. 总结与行业启示