[CVPR 2025] SO3UFormer:摆脱重力束缚,实现 full-SO(3) 鲁棒的全景语义分割
SO3UFormer: Learning Intrinsic Spherical Features for Rotation-Robust Panoramic Segmentation
本文提出了 SO3UFormer,一种针对全景语义分割的旋转鲁棒性(Rotation-robust)分层快照 Transformer 架构。通过引入规范感知的相对位置机制和正交一致性注意力,该方法在 Pose35 挑战赛中实现了 72.03 mIoU,且在极端 SO(3) 旋转测试下仍能保持 70.67 mIoU,远超现有 SOTA 模型。
TL;DR
在全景视觉领域,我们一直默认相机是“端正”的。然而,无人机的摇摆、手持设备的抖动会让这种假设瞬间崩塌,导致主流模型性能从 SOTA 直接跌入谷底(mIoU 下滑超过 40%)。SO3UFormer 通过一套纯粹的“内在几何(Intrinsic Geometry)”设计方案,彻底移除了对绝对坐标的依赖,使全景分割模型在全 3D 空间任意旋转下依然稳如泰山。
背景定位:被掩盖的“重力偏差”
目前绝大多数全景分割算法(如 SphereUFormer, Elite360)在标准测试集上表现惊艳,其背后隐藏着一个巨大的“作弊”嫌疑:过度拟合纬度信息。 由于数据集(如 Stanford2D3D)大多是水平拍摄,模型学会了“下方即地板”的逻辑。一旦相机发生滚转(Roll)或俯仰(Pitch),“地板”出现在图像上方时,模型会因为绝对位置编码的误导而完全丧失判断力。
左图展示了当相机旋转时,传统方法由于依赖重力方向导致分割失败(Fail),而 SO3UFormer 保持了语义一致性。
痛点深挖:为什么 Transformer 在球面上会过拟合?
主要的症结在于两点:
- 绝对编码的毒药:Absolute Positional Encoding 强行绑定了经纬度,给模型提供了全局参考系。
- 测度不一致性:球面网格(如 ERP 或二十面体剖分)在不同区域的采样密度是不均匀的,标准的 Self-Attention 会给采样密集的区域分配过高权重,导致几何失真。
核心方法论:SO3UFormer 的三位一体设计
1. 规范感知的相对位置 (Gauge-Aware RPM)
为了取代全局经纬度,作者在每个查询点的**切平面(Tangent Plane)**内定义局部几何。通过计算测地线距离(Geodesic distance)和局部切向量夹角,利用傅里叶级数进行参数化。为了消除切平面内部旋转的不确定性,作者引入了 Discrete Gauge Pooling(离散规范池化),通过对 6 个固定旋转方向进行均值池化,实现了旋转不变的局部特征描述。
2. 正交一致性注意力 (Quadrature-Consistent Attention)
作者提出在 Attention Logit 中显式加入面积权重 : 这一改进使得注意力机制从离散点的加权变成了球面上的面积积分近似,极大缓解了由极点采样密集导致的计算偏差。
3. 几何一致性采样
普通的线性插值会引入图表畸变。SO3UFormer 使用了基于余弦极大值的父节点分配机制进行下采样,并使用基于测地线核(Geodesic Kernel)的卷积进行上采样,确保特征在不同分辨率间传递时,其空间语义依然锚定在球面上而非像素平面。
SO3UFormer 整体架构:基于二十面体离散化的 U 型网络,核心在于其内化的几何算子。
实验战绩:Pose35 压力测试
为了证明该方法的有效性,作者构建了 Pose35 数据集(添加 ±35° 的随机旋转)。
| 方法 | 基准 mIoU | SO(3) 旋转 mIoU | 性能下降 |
|---|---|---|---|
| SphereUFormer | 67.53 | 25.26 | -42.27 |
| SO3UFormer (Ours) | 72.03 | 70.67 | -1.36 |
消融实验分析: 数据证明,仅靠移除绝对位置编码就能让 SO(3) 表现从 25.26 跳升至 64.66。而后续加入的 Gauge-pooled 偏置和几何采样进一步将差距缩小到极微小的程度。
可视化对比:在大幅度倾斜的场景下,其他方法(b-e列)对地板和墙壁的预测完全错乱,而 SO3UFormer (f列) 依然精准。
深度洞察与总结
SO3UFormer 的成功揭示了一个深刻的道理:在处理流体数据时,架构的对称性(Symmetry)比单纯的模型规模更重要。通过将三维空间旋转的等变性/不变性嵌入到 Transformer 的底层算子中,我们不仅获得了更好的泛化性,更摆脱了对数据增强(Augmentation)的重度依赖。
局限性:尽管实验在离散旋转上表现优异,但在超高分辨率下的计算开销(由于复杂的 RPM 计算)仍有优化空间。此外,如何将这种几何感知扩展到处理动态运动导致的光流畸变,将是下一个前沿课题。
