[CVPR 2025] VGGT-Det:摆脱传感器束缚,深度挖掘重建模型中的 3D 探测先验
VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
本文提出了 VGGT-Det,这是首个针对无传感器几何(Sensor-Geometry-Free, SG-Free)室内多视图 3D 检测的 Transformer 框架。该方法通过挖掘预训练 VGGT 模型的内部先验,在无需相机姿态和深度输入的情况下,在 ScanNet 和 ARKitScenes 数据集上刷新了 SOTA 纪录。
TL;DR
传统的室内 3D 检测往往需要精准的相机轨迹(Pose),这就像是给算法配了个“GPS”。但在现实中,我们更多面对的是只有几张照片的随机场景。VGGT-Det 率先实现了高精度的 无传感器几何 (SG-Free) 检测,它不仅不需要 Pose,还能从预训练的重建模型(VGGT)内部偷取“语义”和“几何”两种先验。其在 ScanNet 上的表现提升了 4.4 mAP,而显存占用却不到基线的四分之一。
背景:当 3D 检测失去“上帝视角”
在全自动驾驶或高端机器人领域,我们可以依靠昂贵的雷达和校准过的相机阵列。但在手机 AR 或家用机器人场景中,获取精确的相机位姿(Extrinsics)和深度图代价昂贵。
目前的 SG-Free 研究大多把 3D 重建模型当作一个黑盒:先重建点云,再塞进检测器。这种做法极其低效,因为重建模型在学习“如何构建空间”时,内部其实已经理解了“哪里是物体”以及“空间特征的演化”。VGGT-Det 的核心直觉就是:与其只吃重建模型的“剩菜”(预测结果),不如直接拆开它的“胃口”(内部特征层和注意力图)。
核心方法论:AG 与 QD 的精妙配合
1. 注意力引导查询生成 (Attention-Guided Query Generation, AG)
作者发现了一个有趣的物理直觉:即使 VGGT 没用语义标签训练过,它的 Attention Map 也会自发地聚焦在物体(如椅子、床)上。
- 传统做法:使用最远点采样 (FPS) 在点云里瞎找点。
- AG 做法:将 Attention 权重与空间距离融合。Query 会优先落在“看起来更像物体”且“分布较散”的区域。 这解决了传统 Query 容易落在背景墙面上导致检测失效的痛点。
图 2: VGGT-Det 整体架构,展示了 AG 和 QD 模块如何插入 Transformer 流程
2. 查询驱动特征聚合 (Query-Driven Feature Aggregation, QD)
VGGT 的不同层代表了特征从 2D 到 3D 的演化过程。
- See-Query 机制:作者引入了一个特殊的代理 Token——"See-Query"。它会去问 Object Queries:“嘿,你们现在缺什么信息?”
- 动态权重:根据反馈,See-Query 会给 VGGT 的浅层(细节)和深层(全局几何)分配不同的注意力权重,实现特征的动态按需聚合,而不是盲目地堆叠多尺度特征。
实验战绩:强悍的鲁棒性
在 ScanNet 榜单上,VGGT-Det 不仅在精度上全面超越了需要 Pose 的 MVSDet,更展现了惊人的抗噪能力。即便给输入的点云加上剧烈的 Gaussian Noise,VGGT-Det 依然能保持 34.1 的 mAP,而传统的点云检测器 FCAF3D 直接崩到了 0。
表 1: 在 ScanNet 上的详细对比,VGGT-Det 在几乎所有类别上均有提升
此外,显存效率的优化是该文的另一亮点。通过精简的特征通路,它在 1x H800 GPU 上仅需 3.57GB 显存,极大地降低了端侧部署的门槛。
深度洞察
VGGT-Det 的成功揭示了视觉大模型时代的一个新范式:内部表征挖掘优于外部结果堆叠。
- Inductive Bias 的利用:AG 模块成功地将“物体性”(Objectness)这一归纳偏置通过 Attention Map 提取出来。
- 动态性是关键:QD 模块证明了固定权重的特征融合在 SG-Free 场景中不够鲁棒,动态交互才是处理不确定几何信息的良方。
局限性:尽管精度很高,但 VGGT 基础模型的推理延迟(0.68s)在实时任务中仍显沉重。未来的机会点在于开发更轻量化的“重建-检测”一体化 Backbones。
总结
VGGT-Det 巧妙地利用了预训练 Transformer 的内部“肌肉记忆”来解决复杂的 3D 空间问题。它告诉我们,在 AI 2.0 时代,最好的先验往往就藏在模型已经看过的千山万水之中。
