[CVPR 2025] EmbodMocap: 仅需两机两手,开启野外 4D 人机交互数据采集新范式
TrajTok: Learning Trajectory Tokens enables better Video Understanding
本文提出了 EmbodMocap,一种仅需两台移动 iPhone 即可在野外环境捕捉高精度 4D 人体及场景数据的便携式重构系统。该方法通过双视图 RGB-D 联合校准,实现了厘米级的 metric-scale 环境对齐,在多项 Embodied AI 任务中达到了 SOTA 表现。
TL;DR
具身智能(Embodied AI)的基础是理解人类如何在真实物理空间中行动。然而,获取高质量的人体-场景交互数据却一直处于“贵族门槛”:要么在昂贵的 Vicon 实验室里跳舞,要么穿上几万美元的感应服。
EmbodMocap 横空出世,它宣布:只要两台 iPhone 加上一套精妙的几何校准算法,你就能在任何卧室、花园或街道,捕捉到足以训练人形机器人的厘米级精度 4D 数据。 该工作在单目重建漂移严重、双目深度不一致的痛点上,实现了质的飞跃。
痛点深挖:为什么“单机”或“穿戴式”都不行?
在具身智能的坐标系中,人体运动不是孤立的,它必须与场景(如沙发、梯子)产生具体的物理接触。
- 光学动捕系统 (Vicon/OptiTrack):极其精准,但只能在室内,范围受限,且价格是 EmbodMocap 的 20-60 倍。
- 穿戴式 IMU 动捕:容易产生累计误差,且传感器会遮挡人体外观,不利于视觉算法微调。
- 单目 RGB(D) 算法:虽然廉价,但在面对自遮挡(Self-occlusion)或沿相机轴向的深度移动时,误差通常高达 30cm 以上。
这就导致了一个核心难题:我们缺一套既便宜、又能在野外运行、还能保证物理一致性(不穿模、能触碰)的工具链。
核心技术:四阶段“联合缩放”重构法
EmbodMocap 的核心直觉是:利用场景的静态稳定性来“锚定”动态的人体。

- 场景建模 (Stage I):先用一台 iPhone 扫描场景。利用 SpectacularAI SDK 获取带物理尺度的 Z-up 坐标系。
- 序列预处理 (Stage II):两位摄影师手持 iPhone,以 60°-120° 的夹角跟随拍摄表演者。利用激光笔(Laser pointer)消失的瞬间作为帧级同步信号。
- 多约束校准 (Stage III):这是最关键的一步。作者引入了 (点追踪一致性)、(局部-全局点云对齐) 和 (束调整)。它强制要求:从两个视角看到的同一个人体表面点,在回投影到 3D 空间后必须重合。
- 运动精修 (Stage IV):将双目观测到的 2D 关键点进行三角测量,反推 3D 关节点位置,并据此优化 SMPL 模型的参数(Pose, Shape, Translation)。
实验战绩:让误差从“米”级降至“厘米”级
在光学动捕房的严苛对比测试中,单目模型(如 GVHMR)在长序列下的 RTE(根平移误差)快速飙升。而 EmbodMocap 显著抑制了沿深度方向的漂移。

关键发现:
- 消融实验证明: 追踪损失和 3D 关键点约束对精度提升最大。少了它们,IoU 会剧降 20% 以上。
- 物理真实性:在物理引擎(Isaac Gym)中测试发现,基于单目估计的数据往往让机器人直接摔倒,而 EmbodMocap 捕捉到的动作即便在“单手支撑(Support)”这种极高难度任务中,成功率也高达 66%(对比单目的 20%)。
下游应用:从仿真走向真实机器人
EmbodMocap 采集的数据不仅仅是“好看”,它在以下三个领域展示了极强的“实战力”:
- 单目模型微调:利用其高质量的“RGB + 准确 SMPL”数据对喂给 π3 和 VIMO 模型,使得这些模型在处理纯单目视频时也获得了更强的尺度感(Metric-scale)。
- 物理角色技能训练:实现了爬行、坐下、仰卧、甚至非标准技能(如 Prone 俯卧)。
- 人形机器人控制:通过实拍视频重构动作,再经由 Sim-to-Real 强化学习,成功在 80cm 高的真实人形机器人上部署了“侧翻”等复杂接触类动作。

总结与局限
EmbodMocap 虽然强大,但仍依赖于稳定的 SLAM 信号。在光照极强导致特征点丢失、或场景中存在大量移动物体时,校准依然会失败。此外,目前的 iPhone LiDAR 探测距离上限约为 5 米,限制了大范围空间的单次建模。
Takeaway:这项工作最大的贡献在于去专业化。它证明了对于具身智能研发,高质量的数据不一定非要从昂贵的实验室产生,通过算法对冲消费级硬件缺陷的“野外采集”路径已经完全打通。
