[2026] DVD:打破生成幻觉,单次前向解锁视频深度估计的“确定性”
DVD: Deterministic Video Depth Estimation with Generative Priors
本文提出了 DVD (Deterministic Video Depth),这是首个将预训练视频扩散模型确定性地转化为单次前向深度回归器的框架。该方法在 KITTI 和 ScanNet 等多个基准测试中实现了 SOTA 的零样本 (Zero-shot) 性能。
TL;DR
长期以来,视频深度估计一直受困于生成模型的“随机幻觉”与判别模型的“数据饥渴”。本文提出的 DVD 框架首次实现了对预训练视频扩散模型(如 Wan2.1)的确定性适配。通过将扩散过程转化为单次回归,DVD 在使用不到 1% 标注数据的前提下,实现了超越所有 SOTA 方法的零样本泛化能力和长视频几何一致性。
核心痛点:幻觉与歧义的博弈
在视频深度估计坐标系中,开发者以往只能二选一:
- 生成式 (Generative) 范式:如 DepthCrafter。优点是先验强,能处理纹理缺失;缺点是每次采样结果不同,导致几何结构在时间轴上疯狂抖动(幻觉)。
- 判别式 (Discriminative) 范式:如 Video Depth Anything。优点是输出稳定;缺点是遇到运动模糊就“装瞎”,且需要动辄数千万帧的昂贵真值数据进行训练。
DVD 的核心 Insight 是: 视频基础模型(Video Foundation Models)本身就是一个强大的“世界模拟器”,它已经理解了物理世界的几何演变。我们不需要让它反复采样生成,而是应该将其“固定”下来,作为一个确定性的特征提取器。
技术拆解:如何实现“稳、准、狠”?
1. 步长作为结构锚点 (Timestep as Structural Anchor)
在扩散模型中,时间步 通常代表噪声水平。DVD 发现, 实际上充当了频率滤波器:
- 大 :关注全局低频结构,输出稳定但模糊。
- 小 :关注局部高频细节,输出锐利但易崩溃。 DVD 通过将 固定在 0.5 左右(见下图),找到了全局稳定性与细节表现力的最优平衡点。

2. 潜空间流形修正 (LMR) —— 告别“均值模糊”
确定性回归(L2 Loss)有一个通病:在不确定的区域,模型倾向于预测所有可能性的平均值,导致边缘变秃(Mean Collapse)。 DVD 引入了 LMR (Latent Manifold Rectification),在 VAE 的潜空间中显式施加一阶微分约束:
- 空间维度:强制对齐深度梯度,保留锐利边界。
- 时间维度:强制对齐帧间流量,消除频闪。

3. 全局仿射相干性:长视频的“粘合剂”
由于 GPU 显存限制,处理超长视频必须依赖滑动窗口。生成模型每一窗的尺度(Scale)和偏移(Shift)都在随机漂移。 DVD 发现了一个惊人的特性:确定性适配后的 VAE 解码器误差几乎是线性的。 因此,DVD 采用了一种极简的“最小二乘法”对齐策略:只需计算重叠区域的仿射变换(Affine Alignment),就能将数千帧的视频完美缝合,无需复杂的特征匹配。
实验战绩
DVD 的表现可以用“四两拨千斤”来形容:
- 数据效率:仅用 367K 帧合成数据(VDA 的 1/163),便在真实场景中刷新了 SOTA。
- 几何保真度:在边缘召回率 (B-Recall) 上远超同类模型。
- 单图能力:通过图像-视频联合训练 (Joint Training),DVD 甚至在静态图深度估计上也极具竞争力。

深度总结
DVD 的出现标志着视频深度估计从“生成博弈”转向了“先验挖掘”。它证明了通过合理的数学约束(维度修正)和工程预设(结构锚点),庞大的视频生成模型完全可以变身为精准的物理测量工具。
局限性预测:虽然单次前向极大提升了速度,但目前仍依赖这类如 Wan2.1 级的重型 DiT 骨架,未来通过轻量化蒸馏(Distillation)将其部署到端侧将是下一个争夺的高地。
