[CVPR 2026] ConfCtrl:当视频插值遇见卡尔曼滤波,大视角合成的精确操控之道

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

总结
问题
方法
结果
要点
摘要

本文提出了 ConfCtrl,一种基于预训练视频插值模型(WAN-2.1)的精确相机控制框架,旨在解决大视角变化下的稀疏新视角合成任务。其核心通过置信度感知的点云初始化和受卡尔曼滤波启发的 Predict-Update 调节机制,显著提升了生成的几何一致性与相机轨迹遵循精度。

TL;DR

针对稀疏输入(仅两张图)且存在剧烈视角变化的新视角合成(Novel View Synthesis, NVS)难题,ConfCtrl 提出了一种全新的视角。它没有选择从零训练 3D 模型,而是巧妙地将预训练视频插值模型“重塑”为可控视角生成器。通过置信度感知的点云初始化Predict-Update(预测-更新)卡尔曼调节机制,ConfCtrl 解决了扩散模型在长距离视角变换中“跟不准相机曲线”及“几何畸变”的老大难问题。

痛点深挖:为什么 Diffusion “跟不准”相机?

目前的主流方法分为两派:

  1. 回归派 (Regression-based):如 PixelSplat,能死磕相机参数,但遇到没见过的区域就容易产生伪影,缺乏“想象力”。
  2. 扩散派 (Diffusion-based):如 CameraCtrl,生成效果惊艳,但相机控制往往是“软约束”,在大尺度位移下,模型容易“放飞自我”,生成的视角与预设轨迹对不上。

作者观察到:目前的扩散模型大多直接把投影点云和相机位姿拼接(Concatenate)后丢进去。但问题是,自动生成的点云本身就是有噪声、有畸变的。模型如果不分青红皂白地全盘接受(Conditioning),必然会导致生成的图像跟着一起崩坏。

核心逻辑:ConfCtrl 的双重保险

1. 从“半成品”开始:置信度感知初始化

传统的 Rectified Flow 往往从纯高斯噪声 开始。ConfCtrl 认为这太难为模型了。它利用 VGGT 等 3D 基础模型提取带置信度的点云,并将加权后的潜变量融入初始噪声中:

这里的 是置信度图。直觉很简单:靠谱的点云多保留,不靠谱的(如遮挡区)留给模型去生成。

2. Kalman DiT Block:预测与更新的博弈

这是本文最精彩的设计。作者在 Wan2.1 的 DiT Block 中插入了受卡尔曼滤波启发的模块:

  • 预测 (Prediction):根据当前的相机位姿(Plücker Coordinates)预测下一帧应该长什么样。
  • 更新 (Update):将第一步预测的特征与点云“测量值”对比,学习一个残差修正量

这种机制允许模型在点云信号质量差时,更多依赖相机轨迹的先验知识,从而在保证几何一致性的同时,不被错误的深度信息带偏。

ConfCtrl 架构图 图 1:ConfCtrl 整体框架。左侧展示了基于视频插值的结构,右侧详解了 Kalman DiT Block。

实验战绩

在 CO3D 和 DL3DV 这种极具挑战性的真实场景数据集上,ConfCtrl 展现了恐怖的统治力。

  • 相机遵循精度:平移误差()和旋转误差()相比之前的 SOTA(如 Uni3C)有显著下降。
  • 视觉质量:PSNR 和 SSIM 均有提升,特别是在处理遮挡区域补全时,产生的瑕疵更少。

结果对比图 图 2:与基线模型的定性对比。可以看到 ConfCtrl 在大视角切换下生成的物体结构更稳定,纹理更清晰。

深度洞察与总结

ConfCtrl 的成功不仅仅是因为采用了视频插值模型,更在于它对**不确定性(Uncertainty)**的敬畏。通过引入置信度图和卡尔曼更新机制,它打破了“暴力 Conditioning”的思维定式,为复杂场景下的精确相机控制提供了新的算子范式。

局限性:尽管通过插值解决了跳变,但目前仍受限于 VAE 的潜在表达能力。在处理极端极速运动时,VAE 可能会引入模糊或重影。去掉 VAE 直接在像素级或特征级进行控制,或许是下一个学术高地。

发现相似论文

试试这些示例

  • 查找最近其他试图在视频生成模型中引入 Kalman Filter 或类似状态空间模型(SSM)机制以提升长时一致性的论文。
  • VGGT (Visual Geometry Grounded Transformer) 作为 3D 几何基础模型的原始论文是什么,它是如何评估投影置信度的?
  • 有哪些研究探讨了在没有 VAE 的潜空间下直接进行大规模视频扩散模型训练的方法,以解决本文提到的 VAE 限制问题?
目录
[CVPR 2026] ConfCtrl:当视频插值遇见卡尔曼滤波,大视角合成的精确操控之道
1. TL;DR
2. 痛点深挖:为什么 Diffusion “跟不准”相机?
3. 核心逻辑:ConfCtrl 的双重保险
3.1. 1. 从“半成品”开始:置信度感知初始化
3.2. 2. Kalman DiT Block:预测与更新的博弈
4. 实验战绩
5. 深度洞察与总结