[CVPR 2025] FaceCam:告别畸变,尺度感知的人像视频相机控制新范式
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning
FaceCam 是一个专门为单目人像视频设计的相机控制生成系统。它引入了尺度感知的面部关键点表示法,通过微调 Wan 视频大模型,实现了在保持身份一致性和动态细节的同时,对视频进行精确的相机轨迹操控(如平移、缩放、环绕)。
TL;DR
人像视频的后期视角切换一直是个难题。传统的相机控制 AI 往往会让脸部“变形”或者让发丝变得“模糊”。FaceCam 改变了游戏规则:它放弃了生硬的相机参数输入,转而利用**面部关键点(Facial Landmarks)**作为导航。它不仅能让单目视频实现好莱坞级的环绕、推拉镜头效果,还能完美锁死人物身份和微表情。
背景定位:这是针对人像垂类场景对 Wan/Hunyuan 等 Foundation Video Models 进行精准下游控制的突破性工作,解决了 3D 重建不准导致生成崩溃的痛点。
1. 痛点:为什么相机控制总让脸“崩了”?
在处理单目人像视频时,现有方法(如 CameraCtrl, TrajectoryCrafter)主要面临两大困境:
- 尺度模糊 (Scale Ambiguity):给模型一个“相机向右移动 10cm”的指令,模型不知道这 10cm 相对于人脸是大还是小。如果人脸占满屏幕,10cm 的位移巨大;如果只是远景,则微乎其微。这导致生成的视频经常出现漂移。
- 重建误差的放大:基于 3D 重建的方法如果点云估计错了一点,渲染出来的脸部就会出现扭曲(Artifacts),人类对人脸极其敏锐,这种失真不可接受。
2. 核心直觉:关键点即相机(Correspondence is All You Need)
FaceCam 的核心 Insight 是:2D 图像空间中的点对应关系足以描述相机的相对运动。
作者不再告诉模型“R=... t=...”,而是渲染一个虚拟的 3D 头部模型在目标轨迹下的 2D 关键点图(Landmark Maps)。
- 直观性:关键点直接定义了脸在画面里的位置和形状。
- 尺度感知:关键点图是在像素空间定义的,天然解决了物理单位带来的尺度歧义。
图注:FaceCam 训练流程。左侧展示了如何将关键点作为条件注入 Diffusion Transformer (DiT) 结构中。
3. 训练策略:让“死”相机变“活”
高质量的动态相机人像视频极难获取。作者巧妙地利用了 NeRSemble 数据集(录制时人物动,相机不动),通过以下手段“造”出了运动数据:
- Synthetic Camera Motion:对静态图像进行缩放(Zoom)和平移(Pan)的插值模拟。
- Multi-shot Stitching (多镜头拼接):最绝的一招。在训练时,随机拼接 1-4 个不同视角的视频片段。虽然这种拼接是跳跃的,但实验证明,模型学会了各视角间的空间关联,推理时能够生成极其丝滑的连续轨迹。
4. 实验战绩:全方位超越基线
在与 ReCamMaster (参数控制) 和 TrajectoryCrafter (重建控制) 的对抗中,FaceCam 在各项指标上均处于领先。
图注:在 Ava-256 数据集上的对比。可以看到 ReCamMaster 在大角度转动时人脸直接飞出了画幅(出界),而 TrajectoryCrafter 出现了严重的五官塌陷。
核心结论:
- 身份保持(Identity Preservation):通过 ArcFace 评分,FaceCam 对人物特征的保护最为稳固。
- 细节复现:无论是复杂的发型(如丸子头)、手部动作,还是佩戴的耳机、首饰,FaceCam 都能在镜头移动中保持物理一致性。
5. 深度洞察与局限性
FaceCam 的成功在于它找到了相机参数与图像像素之间的“公约数”——面部几何拓扑。
局限性 (Limitations):
- 背面视角缺失:由于依赖面部关键点,当相机绕到后脑勺(看不到脸)时,系统会失效。
- 背景连贯性:目前的训练集多为纯色或简单背景,处理背景极其复杂的户外场景时,有时会出现轻微的背景闪烁。
未来展望: 这一方案可以推广到任何有强先验的物体。只要我们能定义出类似关键点的结构化表示,甚至可以实现对汽车、宠物视频的专业级运镜控制。
本文由资深学术主编基于 arXiv 论文重构,FaceCam 标志着个人视频创作向“专业级运镜控制”迈进了一大步。
