[CVPR 2025] WHOLE:突破第一视角遮挡,实现世界坐标系下的手-物交互 4D 重建
WHOLE: World-Grounded Hand-Object Lifted from Egocentric Videos
本文提出了 WHOLE,一种从第一视角(Egocentric)视频中实现世界坐标系下(World-grounded)手-物交互整体重建的方法。该方法通过多模态扩散模型(Diffusion-based Motion Prior)联合建模双手与物体的 4D 轨迹,在 HOT3D 等基准测试中达到了 SOTA 性能。
TL;DR
斯坦福大学与 Amazon FAR 团队推出的 WHOLE 模型,通过学习一个强大的生成式运动先验 (Generative Motion Prior),解决了第一视角视频中手部和物体被严重遮挡或移出视野时的重建难题。它不仅能恢复手部关节,还能在统一的世界坐标系下精确追踪物体的 6D 位姿。
1. 痛点:为什么第一视角重建这么难?
在佩戴式设备(如 Aria 眼镜)拍摄的视频中,重建“人与环境的交互”面临三大挑战:
- 剧烈运动:相机随头部转动,导致画面背景飞速切换,物体在图像坐标系中的位姿极不稳定。
- 严重遮挡:手部操作物体时,两者互相遮挡,甚至物体完全离开相机视野(Out-of-view)。
- 不一致性:如果分别用最好的手部模型和物体模型(如 FoundationPose)独立预测,手和物体往往会出现“漂浮”或“穿模”等违背物理规律的现象。
2. 核心直觉:从“检测”转向“引导生成”
作者认为,与其费力去从模糊、残缺的画面中“检测”位姿,不如利用 AI 的想象力去“补全”动作。 WHOLE 的核心工作流如下:
- 训练阶段:在 HOT3D 数据集上训练一个 Diffusion Model。这个模型学习的是:给定物体几何形状后,手和物体应该如何自然地互动? 比如抓取时手部肌肉的收缩速度、物体随手部移动的刚性关联等。
- 推理阶段(引导采样):在生成过程中,通过视频提供的 2D Mask(物体掩码)和 VLM 识别出的 Contact(接触信号) 作为约束梯度。哪怕物体暂时消失了,Diffusion 先验也能根据之前的惯性和手部的动作,推断出物体在世界空间里的合理位置。
图注:WHOLE 的生成过程,交替执行扩散去噪步与视觉引导步。
3. 技术亮点:VLM 驱动的接触感知
为了让重建结果符合物理逻辑,WHOLE 引入了视觉语言模型(VLM,如 GPT-4o 或 Gemini)来自动判断“手是否摸到了物体”。
- 空间提示(Spatial Prompting):作者在图像上叠加颜色掩码(图 3),让 VLM 能在复杂的室内场景中精准分辨哪只手在操作哪个物体。
- 校准效果:经过这种视觉提示和上下文示例学习,VLM 的接触检测 F1 分数从 57% 狂飙到 81%。

4. 实验表现:吊打独立模型
在对比实验中,WHOLE 展示了降维打击般的优势。尤其是在物体出视野或被截断的任务中,传统 SOTA 模型(如 FoundationPose)的 ADD 指标骤降,而 WHOLE 凭借“运动先验”保持了极高的鲁棒性。

关键战绩:
- 物体位姿 (ADD-S):从 51.9% 提升至 69.9%。
- 手部平滑度 (ACC-NORM):误差从 4.15 降至 0.58。
- 交互一致性:生成的物体不再“虚空漂浮”,而是严丝合缝地贴合手掌。
5. 资深主编点评
WHOLE 的成功在于它深刻理解了第一视角交互的本质:视觉流是不平稳的,但物理交互是有规律的。
通过将复杂的交互动力学建模为条件扩散过程,WHOLE 成功绕过了纯视觉方案在极端遮挡环境下的“死穴”。此外,该方法不仅能用于重建,还能作为一个 HOI Planner:如果你给模型一个粗略的手部轨迹,它能自动反推出物体应该如何被搬运,这在具身智能(Embodied AI)和机器人抓取规划中极具应用价值。
局限性:目前仍需已知物体的 3D 模板。未来的演进方向必然是走向“万物皆可重构”的无模板(Template-free)泛化方案。
