[CVPR 2025] WorldStereo:以 3D 几何记忆构筑一致性,让视频生成真正迈向“世界模型”
WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories
本文提出了 WorldStereo,一个旨在弥合摄像头引导的视频生成与 3D 场景重建之间鸿沟的新型框架。通过引入全局几何记忆(GGM)和空间立体记忆(SSM)模块,该方法在保持视频视觉质量的同时,显著提升了多视角生成内容的一致性,从而实现了高质量的 3D 重建。
核心速览
TL;DR:WorldStereo 是一个能够生成高度 3D 一致视频并支持高质量重建的框架。它通过“全局几何记忆 (GGM)”保障大尺度结构,通过“空间立体记忆 (SSM)”锁死局部细节,并利用 DMD 技术将推理耗时缩短了 95%。
背景定位:该工作是摄像头引导视频生成领域的重要突破。它不仅是一个视频生成工具,更是一个高效的“生成式 3D 重建”方案,解决了从单图/全景图出发进行 3D 场景自由探索的一致性的难题。
痛点深挖:为什么视频生成很难直接做 3D 重建?
尽管 Sora 等模型展示了惊人的视频效果,但对于 3D 重建而言,它们生成的画面往往存在“幻觉”。现有的 Camera-guided VDM 存在两个核心局限:
- 记忆缺失:模型在生成新视角时,往往忘记了之前视角的细节,导致纹理闪烁。
- 几何偏移:即便有摄像头参数引导,生成的几何结构也难以满足严苛的对极几何(Epipolar Geometry)约束,导致重建后的点云是一团散沙。
方法论详解:几何感知的双重记忆
WorldStereo 的精髓在于将 3D 几何信息转化为模型的“长期”与“短期”记忆:
1. 全局几何记忆 (Global-Geometric Memory, GGM)
GGM 充当了建筑的“脚手架”。它将之前帧生成的深度图转化为点云,并汇总到一个全局 3D Cache 中。在生成后续轨迹时,这个增量更新的点云会通过 ControlNet 注入模型,确保模型始终在正确的物理空间内“填色”。
2. 空间立体记忆 (Spatial-Stereo Memory, SSM)
如果说 GGM 是框架,SSM 就是“瓷砖贴图”。
- 直觉:借鉴双目视觉(Stereo Matching),新视角的生成必须参考最接近的已知视角的像素。
- 架构:模型会从存储库中检索特征相似的视角,并将目标帧与参考帧横向拼接(Stitched)。
- Pointmap 约束:通过计算两帧之间的 3D 对应关系,生成 Pointmap,强制注意力的感知范围集中在 3D 空间中物理位置相同的区域。
图 2 & 3:WorldStereo 整体流程图。左侧为 GGM 基于全局点云的引导,右侧为 SSM 特有的目标-参考帧拼接机制。
实验与结果:从 162 秒到 9 秒的飞跃
研究人员在 Tanks-and-Temples 等严苛的重建基准上进行了测试。结果显示,WorldStereo 重建出的点云完整度和精确度(F1-Score)远超前人。
更具工业价值的是,通过 DMD (Distribution Matching Distillation) 蒸馏,原本需要 40 步生成的扩散过程被压缩至 4 步。
- 推理速度:在 H20 GPU 上,生成一段视频仅需 9 秒,相比之前的 162 秒提升了约 20 倍。
- 一致性:即便是 4 步生成的画面,在 3D 一致性指标上依然非常稳健。
图 4:在不同轨迹下的重建效果对比。可以看到 WorldStereo 生成的点云(右下)在结构完整性和细节丰富度上明显优于 baseline。
深度洞察:为何它有效?
- 解耦控制与生成:作者巧妙地通过控制分支注入几何记忆,而不去 joint-train 主干网络。这保留了 Foundation Model 原本的视觉生成能力,避免了模型“变笨”或生成的图像失去质感。
- 局部注意力的妙用:在 SSM 中,通过限制 Attention 的感受野,让目标帧倾向于从特定的参考帧吸取营养,这种显式的 3D 对应大大降低了模型学习“跨视角一致性”的难度。
总结与展望
WorldStereo 展示了当视频生成模型(VDM)拥有“几何大脑”时,其在 3D 场景生成领域的巨大潜力。尽管该方法依赖于高质量的初始深度预测(如 MoGe),但其双重记忆架构为通向物理一致的通用世界模型提供了一个极其扎实的基准。
未来,若能将这种机制应用于动态场景生成,我们或许离电影级的“一鍵建城”就不远了。
