ActCam:零样本联合相机与 3D 动作控制,重塑视频生成的电影级质感

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

总结
问题
方法
结果
要点
摘要

本文提出了 ActCam,一种用于视频生成的 Zero-shot(零样本)联合相机与 3D 角色动作控制方法。该方法基于预训练的 Image-to-Video 扩散模型,实现了在无需额外训练或微调的情况下,同时精准控制角色的复杂动作轨迹与相机的 3D 运动路径。

TL;DR

在视频生成领域,如何让“演员”跳得好,且让“摄影师”配合得好,一直是个难题。ActCam 是一项由 Kinetix、牛津大学及 MBZUAI 联合推出的 Zero-shot 框架,它首次在不进行任何模型训练的前提下,实现了对角色 3D 动作和相机 3D 轨迹的精准联合控制。通过将 3D 几何先验巧妙地转化为扩散模型的 dense conditioning,它让普通 AI 模型瞬间具备了电影级的运镜能力。

背景:2D 控制的崩塌与 3D 的必然

目前的视频控制模型(如 ControlNet, AnimateAnyone)大多依赖 2D Keypoints。然而,当相机发生大幅度旋转或位移时,2D 信号会变得极其模糊——同一个 2D 投影可能对应无数种 3D 动作。更糟糕的是,如果环境深度是不变的,而你强行给了一个快速移动的 Pose,画面就会表现出诡异的“滑步”或背景撕裂。

以往的解决办法是“练”,即针对相机控制专门微调一个巨型 Transformer 模型(如 Uni3C)。但这带来了巨大的计算成本,且模型通用性极差。ActCam 的核心直觉是:既然 backbone(如 VACE)已经理解了深度图(Depth)和姿态图(Pose),那么我们只需在输入端把这两种信号在 3D 空间中物理对齐,模型就能自然地输出正确的结果。

核心黑科技:几何感知的条件调度

1. 场景解耦与合成 (Scene Transfer)

为了防止背景深度图中的“静态角色痕迹”干扰正在运动的新角色(这通常会导致重影),ActCam 采用了一套精密的预处理流程:

  • Inpainting:先从参考图中把角色“抠掉”,填补出完整的背景。
  • 3.D Anchor:利用 MoGe 等单目几何估计工具构建背景的 3D 场景。
  • 精细对齐:使用带权重的几何对齐算法,将提取自驱动视频的 3D SMPL 动作模型“安放”在 3D 背景中,确保脚踏实地。

模型架构图 图 1:ActCam 整体流程。从单一参考图和 3D 相机路径出发,构建几何一致的控制信号。

2. 两阶段去噪 (Two-Phase Conditioning)

这是 ActCam 的灵魂所在。作者发现,如果全程强加深度约束,背景会变得过于死板,甚至连衣服褶皱都会被当成错误的几何波动而抹除。

  • Phase 1 (早期):输入 Pose + Sparse Depth。利用高噪声阶段确定场景的宏观布局和视角变化。
  • Phase 2 (后期):只保留 Pose。在细节生成阶段解放扩散模型,让其自由填充高频细节,保证视频的灵动感。

实验表现:越是大幅度运镜,优势越明显

在与 Uni3C 的对比中,ActCam 在处理复杂的绕拍、俯仰等运镜时展现了极高的稳定性。由于没有经过特定数据集的微调,它的成像质量(Imaging Quality)直接继承了基座模型的上限,同时也避免了动作跟随不紧密的问题。

实验结果对比 图 2:用户评分对比。ActCam 在相机贴合度、动作还原度和视觉质量上均大幅领先。

3D 动作稳定性

传统的 2D 方法在角色转身时常发生“肢体瞬移”,而 ActCam 结合了 GVHMR (3D Human Motion Recovery)。这意味着即使角色转到了背面,3D 模型的连贯性也能通过深度引导,传递给扩散模型。

深度洞察与总结

ActCam 的成功再次印证了 "Data/Geometry Engineering over Fine-tuning" 的趋势。与其费力不讨好地训练一个理解相机的专用模型,不如在推理时注入更符合物理直觉的条件信息。

局限性: 虽然 ActCam 是 Zero-shot 的,但它依赖于高性能的单目深度估计和 3D 人体恢复工具。如果前端的 3D 重建出现结构性错误,ActCam 也很难在后端生成时自行修正。此外,极其复杂的遮挡场景(如角色进入树丛后完全消失再出现)仍是此类方法的挑战。

展望: 随着万亿级参数的视频扩散模型(如 Sora、Lumina-Video)不断涌现,像 ActCam 这种能够即插即用的精密控制器,将成为 AI 电影工业化中不可或缺的“摄影控制台(DIT)”。

发现相似论文

试试这些示例

  • 查找最近其他无需微调(Training-free)且能同时实现视频中物体运动控制与相机轨迹控制的 SOTA 方法。
  • 哪篇论文最早在扩散模型中提出了分阶段去噪调度(Staged/Two-phase conditioning)来平衡结构一致性与纹理细节?
  • 调研将 3D 参数化人体模型(如 SMPL)与视频扩散模型结合,以解决跨视角生成中角色比例一致性问题的最新研究。
目录
ActCam:零样本联合相机与 3D 动作控制,重塑视频生成的电影级质感
1. TL;DR
2. 背景:2D 控制的崩塌与 3D 的必然
3. 核心黑科技:几何感知的条件调度
3.1. 1. 场景解耦与合成 (Scene Transfer)
3.2. 2. 两阶段去噪 (Two-Phase Conditioning)
4. 实验表现:越是大幅度运镜,优势越明显
4.1. 3D 动作稳定性
5. 深度洞察与总结