[CVPR 2026] ConfCtrl:当视频插值遇见卡尔曼滤波,大视角合成的精确操控之道
ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
本文提出了 ConfCtrl,一种基于预训练视频插值模型(WAN-2.1)的精确相机控制框架,旨在解决大视角变化下的稀疏新视角合成任务。其核心通过置信度感知的点云初始化和受卡尔曼滤波启发的 Predict-Update 调节机制,显著提升了生成的几何一致性与相机轨迹遵循精度。
TL;DR
针对稀疏输入(仅两张图)且存在剧烈视角变化的新视角合成(Novel View Synthesis, NVS)难题,ConfCtrl 提出了一种全新的视角。它没有选择从零训练 3D 模型,而是巧妙地将预训练视频插值模型“重塑”为可控视角生成器。通过置信度感知的点云初始化和Predict-Update(预测-更新)卡尔曼调节机制,ConfCtrl 解决了扩散模型在长距离视角变换中“跟不准相机曲线”及“几何畸变”的老大难问题。
痛点深挖:为什么 Diffusion “跟不准”相机?
目前的主流方法分为两派:
- 回归派 (Regression-based):如 PixelSplat,能死磕相机参数,但遇到没见过的区域就容易产生伪影,缺乏“想象力”。
- 扩散派 (Diffusion-based):如 CameraCtrl,生成效果惊艳,但相机控制往往是“软约束”,在大尺度位移下,模型容易“放飞自我”,生成的视角与预设轨迹对不上。
作者观察到:目前的扩散模型大多直接把投影点云和相机位姿拼接(Concatenate)后丢进去。但问题是,自动生成的点云本身就是有噪声、有畸变的。模型如果不分青红皂白地全盘接受(Conditioning),必然会导致生成的图像跟着一起崩坏。
核心逻辑:ConfCtrl 的双重保险
1. 从“半成品”开始:置信度感知初始化
传统的 Rectified Flow 往往从纯高斯噪声 开始。ConfCtrl 认为这太难为模型了。它利用 VGGT 等 3D 基础模型提取带置信度的点云,并将加权后的潜变量融入初始噪声中:
这里的 是置信度图。直觉很简单:靠谱的点云多保留,不靠谱的(如遮挡区)留给模型去生成。
2. Kalman DiT Block:预测与更新的博弈
这是本文最精彩的设计。作者在 Wan2.1 的 DiT Block 中插入了受卡尔曼滤波启发的模块:
- 预测 (Prediction):根据当前的相机位姿(Plücker Coordinates)预测下一帧应该长什么样。
- 更新 (Update):将第一步预测的特征与点云“测量值”对比,学习一个残差修正量 。
这种机制允许模型在点云信号质量差时,更多依赖相机轨迹的先验知识,从而在保证几何一致性的同时,不被错误的深度信息带偏。
图 1:ConfCtrl 整体框架。左侧展示了基于视频插值的结构,右侧详解了 Kalman DiT Block。
实验战绩
在 CO3D 和 DL3DV 这种极具挑战性的真实场景数据集上,ConfCtrl 展现了恐怖的统治力。
- 相机遵循精度:平移误差()和旋转误差()相比之前的 SOTA(如 Uni3C)有显著下降。
- 视觉质量:PSNR 和 SSIM 均有提升,特别是在处理遮挡区域补全时,产生的瑕疵更少。
图 2:与基线模型的定性对比。可以看到 ConfCtrl 在大视角切换下生成的物体结构更稳定,纹理更清晰。
深度洞察与总结
ConfCtrl 的成功不仅仅是因为采用了视频插值模型,更在于它对**不确定性(Uncertainty)**的敬畏。通过引入置信度图和卡尔曼更新机制,它打破了“暴力 Conditioning”的思维定式,为复杂场景下的精确相机控制提供了新的算子范式。
局限性:尽管通过插值解决了跳变,但目前仍受限于 VAE 的潜在表达能力。在处理极端极速运动时,VAE 可能会引入模糊或重影。去掉 VAE 直接在像素级或特征级进行控制,或许是下一个学术高地。
