[SpaceSense-Bench] 填补空间感知的最后一公里:136种卫星、三模态对齐的深度视觉基准
SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation
本文推出了 SpaceSense-Bench,一个针对航天器感知与姿态估计的大规模多模态基准数据集。该数据集涵盖 136 种卫星模型,提供同步的 RGB、深度图和 256 线 LiDAR 点云,并在 2D/3D 语义分割等 5 项任务上建立了 SOTA 基线。
TL;DR
在轨道服务和碎片清理任务中,航天器需要像人类一样理解目标的每个零件。然而,受限于数据获取成本,现有的视觉模型往往是“近视眼”或“死记硬背”。SpaceSense-Bench 通过 UE5 仿真生成了 70GB 的海量多模态数据,首次实现了 136 种卫星的部件级标注。研究发现:数据量大确实能出奇迹(泛化性提升 73%),但极小部件和反光表面依然是 AI 的“阿喀琉斯之踵”。
1. 痛点:为什么太空 perception 这么难?
在地球上工作的视觉算法,到了太空往往会“水土不服”。原因主要有三:
- 极限光照 (Extreme Lighting):直射阳光产生的强高光和地影带来的绝对黑暗,让 RGB 传感器频繁失效。
- 几何多样性缺失 (Lack of Diversity):以前的训练集只有 1-2 种卫星,模型记住了“长方体+蓝色翅膀”就是卫星,换个球形卫星(如 Sputnik 风格)就彻底抓瞎。
- 感知精度要求极高:抓取任务需要厘米级的 6-DoF 姿态估计,而不仅仅是画个框。
2. Methodology:自动化构建高保真“宇宙实验室”
为了解决数据荒,作者构建了一套全自动管线。其核心在于将 3D 模型在 Blender 中进行 Instance-level Part Decomposition。
图 1:SpaceSense-Bench 数据采集流程,涵盖 3D 资产分解、UE5 仿真、自适应轨迹规划。
技术看点:
- 三模态完美同步:RGB、深度图、256 线 LiDAR 空间对齐。
- 自适应轨迹:无论是 0.27 米的 CubeSat 还是 112 米的国际空间站(ISS),采样步长都会根据模型尺度自动缩放,保证了采样覆盖的均匀性。
- 七类部件标注:包括主体 (Main Body)、太阳翼 (Solar Panel)、碟形天线 (Dish Antenna)、全向天线 (Omni Antenna)、载荷 (Payload)、推进器 (Thruster) 和适配环 (Adapter Ring)。
图 2:数据集提供的同步数据:RGB、7 类语义掩码、LiDAR 点云、深度图。
3. 实验发现:Scaling Law 在太空依然奏效吗?
作者对 2D/3D 分割、目标检测、深度估计等任务进行了基准测试。
核心结论一:大力出奇迹
通过消融实验发现,训练集卫星种类从 9 种增加到 117 种时,模型在从未见过的测试卫星上的 mIoU 提升了 73%。这证明了增加几何多样性是解决 Zero-shot 泛化问题的最直接手段。
核心结论二:长尾部件是致命伤
尽管主体和太阳翼的识别率很高,但推进器 (Thruster) 和 全向天线 (Omni Antenna) 的 IoU 惨不忍睹(低于 35%)。这些部件像素占比甚至不到 1%,且形状多变。这意味着现有的主流模型(如 SegFormer, Mask2Former)在处理空间小目标时依然乏力。
图 3:各模型在不同部件类别的定量分析结果。
4. 深度洞察与总结
SpaceSense-Bench 的出现,将航天器感知的研究从“特定单体识别”推向了“通用几何理解”。
- 优势:填补了多模态(尤其是 LiDAR)在空间领域的大规模空白,为 3D 视觉导航提供了坚实地基。
- 启发:单纯依靠 Vision Foundation Models(如 Depth Anything)在空间金属表面的表现尚可,但在处理复杂的相对深度排序时仍有欠缺,结合 LiDAR 的多模态融合(如本文实验中的 PMFNet)才是未来的主流路线。
未来研究者不仅要关注如何识别卫星,更要关注如何从不到 100 个像素的微小特征中,提取出足以支撑高精度对接的导航信息。
论文链接:[arXiv 2603.xxxxx] 开源代码:https://github.com/wuaodi/SpaceSense-Bench
