[CVPR 2026] OnlineX:解耦“活跃”与“稳定”,开启实时在线 3DGS 重建新纪元
OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution
本文提出了 OnlineX,一个用于在线 3D 重建与增强语义理解的自回归前馈框架。该方法基于 3D Gaussian Splatting (3DGS),通过创新的 Active-to-Stable 状态演化机制,在仅需流式 RGB 图像且无相机位姿先验的情况下,实现了 SOTA 级的实时场景重建与开置集语义分割。
TL;DR
清华大学的研究团队提出了 OnlineX,这是首个能够从流式 RGB 视频流中实时构建 3D 高斯(3DGS)表示及语言场的通用前馈框架。它通过 Active-to-Stable 状态演化 范式解决了在线重建中的累积漂移难题,在无需预计算位姿的情况下,实现了高质量的视角合成与语义理解。
背景定位:该工作是 3DGS 从“离线拼图”向“在线流式感知”进化的重要里程碑,在机器人、AR 导航等实时场景中极具应用潜力。
痛点深挖:为什么“在线重建”这么难?
当前的 3D 重建 SOTA 方法(如 MVSplat, NoPoSplat)大多是“事后诸葛亮”:它们需要一次性输入完整序列,并依赖 COLMAP 等工具预计算相机位姿。而在机器人或手机端扫描等真实场景中,视频帧是逐帧到来的,模型必须在没有未来信息的情况下进行连续重建。
现有的在线方法(如 CUT3R)尝试用单一隐藏状态来记录历史,但面临一个悖论:
- 活跃角色 (Active):需要频繁刷新,以捕捉当前帧的高频局部几何。
- 稳定角色 (Stable):需要保守记忆,以维持长期全局结构的稳定性。
传统的单状态模型往往在更新局部细节时“弄丢”了全局结构,导致随着视频变长,模型生成的场景会发生扭曲和漂移。
核心动机:Active-to-Stable 的解耦之道
OnlineX 的核心直觉是将这两个角色剥离。作者认为,局部细节提取和全局一致性维护不应该在同一个特征空间纠缠。
1. 架构解析 (Methodology)
OnlineX 由三个关键模块组成,实现了从“相对感知”到“全局对齐”的逐级演化:
- 相对几何提取器 (Relative Geometry Extractor):专注于相邻帧间的特征交互。它提取当前帧相对于前一帧的局部几何、颜色及位姿。这就像人的“瞬时视觉”,只管看清当下的细节。
- 锚点状态指导器 (Anchor State Director):这是体系中的“定海神针”。它维护一个名为 Anchor State 的稳定内存标记(Tokens),通过 Transformer 递归更新。它接收局部特征作为 Query,输出全局一致的位姿特征,并以此作为基准修正局部几何。
- 隐式高斯融合 (Implicit Gaussian Fusion):为了避免随着帧数增加,空间中堆积过多的重叠高斯点,模型在潜空间通过置信度加权平均,将相邻的高斯原语进行融合。

实验战绩:全方位的 SOTA 压制
在多个公开数据集上的测试表明,OnlineX 展现了极强的韧性:
- 长序列稳定性:在 ScanNet 30 帧序列测试中,OnlineX 的 PSNR 达到了 23.73dB,而其他在线方法随长度增长性能剧烈下降。
- 相机位姿精度:其轨迹估计的绝对平移误差 (ATE) 仅为 0.085,显著优于主流的在线基线模型。
- 语义理解:OnlineX 不仅能重建外观,还能生成 3D 语言场(Language Fields),通过输入文字(如 "Wall", "Chair")即可在 3D 空间内精准分割物体。

深度洞察:为什么这种做法有效?
OnlineX 的成功在于其 隐式位姿转换 (Implicit Pose Transformation) 的策略。相比于直接用预测的旋转矩阵 和平移向量 来强行旋转 3D 点云(这会导致严重的累积误差),OnlineX 在特征空间利用 Cross-Attention 进行隐性对齐。这种设计使得全局一致性不是通过硬性的几何叠加实现的,而是通过学习到的特征关联,赋予了模型更强的鲁棒性。
总结与局限
Takeaway:OnlineX 成功将实时性(23 FPS)、通用性(无需场景优化)和长序列稳定性融合在了一个框架内。它是 3D 视觉领域从“数据拟合”迈向“长程推理”的重要一步。
局限性:尽管 OnlineX 在处理室内和街道场景表现优异,但在面对极大规模(如公里级)的城市场景或极高频率的运动时,其锚点状态的存储压力和漂移控制仍有待进一步验证。
