[CVPR 2025] DuoMo:双运动扩散模型——打破非约束视频中的 3D 人体重建瓶颈
DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction
本文提出了 DuoMo,一种用于从非约束视频中恢复世界坐标系(World-space)人体运动的双阶段生成式方法。该方法将任务分解为相机空间导出和世界空间细化两个扩散模型,实现了在动态相机及严重遮挡下的高精度人体三维重建。
TL;DR
在移动相机动态拍摄、主体频繁出镜和遮挡的极端环境下,如何精准恢复人体在真实世界中的轨迹?来自 Meta Reality Labs 和 CMU 的研究团队提出了 DuoMo。通过将运动学习分解为“相机空间感知”与“世界空间细化”两个独立的扩散阶段,DuoMo 在 EMDB 和 RICH 基准上分别实现了 16% 和 30% 的误差大幅削减,且完全摆脱了对 SMPL 等参数化模型的强依赖。
痛点深挖:通用性与一致性的“宿命对决”
在计算机视觉领域,将视频中的人“抠”出来做 3D 重建已非难事。然而,一旦涉及世界坐标系(World-space),问题就变得极其棘手:
- 环境对齐之难:传统方法依赖估计相机相对于地面的位姿,但在山坡、楼梯等复杂地形上,这种对齐极易出错。
- 累积漂移:当主体在视频中快速移动或消失时,简单的帧间累积会导致轨迹像“滑冰”一样飘走。
- 端到端模型的短板:现有的全局模型虽然一致性好,但由于训练数据多来自受控的实验室场景,一到野外就表现得像个“没见过世面的孩子”。
DuoMo 的核心直觉:解耦与变换
DuoMo 的核心 Insight 在于:不要让一个模型干所有的活。作者将其拆解为两个阶段,通过显式的几何变换连接。
1. 相机空间扩散(Stage 1: Camera-space)
这个模型专注于“看图说话”。它提取图像特征,并结合一种独特的**射线编码(Ray Direction Encoding)**处理 2D 关键点,从而隐式地将相机内参(Intrinsics)注入模型。
2. 世界空间细化(Stage 2: World-space)
这是 DuoMo 的杀手锏。它不再尝试寻找一个全局统一的坐标系(如地心坐标系),而是为每个视频定义一个以首帧相机位姿为原点的局部世界坐标系。这种设计规避了复杂的地面校准问题,让模型专注于“去噪”——将带噪的、由于深度歧义导致的人体 proposal 修正为物理连贯的运动。

技术细节:顶点回归与引导采样
与大多数依赖 SMPL 参数库的方法不同,DuoMo 直接生成 595 个网格顶点(Mesh Vertices)。这种“无模型(Model-free)”的偏好赋予了它捕捉更细微动作的能力。
为了解决长时遮挡带来的“断层”问题,作者引入了两项采样引导:
- 2D 重投影引导:确保 3D 结果投影回图像后能对上关键点。
- 位移引导(Displacement Guidance):锁定遮挡前后的起始点,确保生成的补全路径能“落到实处”。
实验战绩:全方位的 SOTA 霸榜
在多个公开数据集上,DuoMo 展现了统治级的表现:
- 精度飞跃:在 EMDB 数据集上,其 root 轨迹误差(RTE)远低于同类竞争者,W-MPJPE 相比前作大幅下降。
- 极致平滑:通过在训练中加入
L_contact损失,DuoMo 在不依靠后处理的情况下,有效解决了令人头疼的“足部滑动”问题。
图:在相机位姿存在不同等级噪声时,DuoMo 展示了比 Cam-lifting 方案更强的韧性(Robustness)。
深度洞察
DuoMo 的意义不仅在于刷榜,它向社区传递了一个信号:生成式先验(Generative Prior)可以作为一种强大的“物理引擎”替代品。在传统优化方法容易陷入局部最优的复杂视频中,扩散模型通过学到的海量运动分布,能自动填补信息的空白。
局限性展望:尽管 DuoMo 极其强大,但它目前还不具备真正的“环境感知”能力(例如它不知道眼前有个沙发)。未来如果能将场景的 3D 几何(Scene Constraints)作为扩散模型的输入,我们或许能看到真正与地形完美契合的人体运动生成。
总结
DuoMo 通过优雅的双阶段扩散架构,成功解决了非约束视频下人体运动恢复的顽疾。对于 VR/AR、体育分析及自动驾驶等领域,这种既鲁棒又精准的 4D 重建技术无疑具有巨大的应用潜力。
