[CVPR 2025] Flow3r:利用 80 万无标签视频解锁大规模视觉几何学习
Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning
本文提出了 Flow3r,这是一个通过 2D 稠密对应关系(Flow)作为监督信号,从无标签单目视频中学习视觉几何(3D 结构与位姿)的框架。通过引入“因子化流预测”(Factored Flow Prediction)机制,Flow3r 在八个静态和动态场景基准测试中达到了 SOTA 性能。
TL;DR
视觉几何推理(从图像恢复 3D 结构和位姿)正处于从传统优化向数据驱动前馈网络转型的关键期。然而,昂贵的 3D 标注成为了制约模型扩展的死穴。Flow3r 提出了一种天才的解决方案:利用无处不在的无标签视频,通过一种**因子化流预测(Factored Flow Prediction)**机制,将 2D 像素移动(Flow)转化为对 3D 几何的强力监督。
该研究证明,即便没有 Ground-truth 深度图,只要“看”过足够多的视频,模型也能学习到极高精度的 3D 表征。
痛点深挖:为什么简单的 Flow 监督行不通?
在 Flow3r 之前,诸如 VGGT 等模型也尝试过加入 Flow 预测作为辅助任务(Tracking Head)。但作者通过实验发现,这种简单的“特征匹配”设计存在本质缺陷:
- 信息瓶颈缺失:传统的 Tracking Head 只是在做局部特征对比,模型只要学会记住纹理就能预测流,而不需要理解三维空间关系。
- 静态假设局限:基于投影公式的流生成方法(Projective Flow)强依赖于静态场景假设,一旦视频中有猫在跑、车在开,投影公式就会失效。
核心方法:因子化流预测(Factored Flow Prediction)
Flow3r 的核心 Insight 是:Flow 应该是几何与位姿的函数。
作者设计了一个非对称的解码过程。为了预测从图像 到图像 的 Flow,模型强制要求:
- 从图像 中提取几何隐变量(Geometry Latent)。
- 从图像 中提取位姿隐变量(Camera Latent)。
- 通过一个 Flow Head 将两者融合,解码出 2D 对应关系。

这种**因子化(Factorization)**设计的妙处在于:如果模型想要预测准确的 Flow,它被迫在几何路径中学习真实的 3D 结构,在位姿路径中学习真实的相机运动。这种设计在动态场景下依然稳健,因为模型可以利用隐空间的处理能力,自动补偿物体的非刚性运动。
实验与结果:无标签数据的胜利
研究团队利用了约 80 万个无标签视频(来自 Kinetics-700, SpatialVID, EPIC-Kitchens 等)进行扩展训练。
1. 扩展性分析 (Scaling Law)
实验表明,随着无标签视频数量的增加(从 3K 到 20K),位姿精度(RRA/RTA)和几何精度(CD/MSE)呈现出近乎线性的提升。甚至在某些指标上,使用 20K 无标签数据配合少量标注的效果,超过了仅使用大量昂贵 3D 标注的模型。

2. SOTA 对比
在包括静态(ScanNet, CO3Dv2)和动态(Sintel, Bonn)在内的八个基准测试中,Flow3r 均超越了现有的最强模型 π3。特别是在野外(In-the-wild)动态视频中,Flow3r 生成的 3D 点云明显更加干净、连贯,减少了前作中常见的“重影”和坐标漂移现象。

深度洞察与总结
Flow3r 的成功标志着“视觉几何学习”正在步入 LLM 式的“大数据时代”。其核心贡献不仅仅是一个更好的模型,而是一套如何利用低成本 2D 信号(光学流)驱动高维度 3D 认知的方法论。
局限性探讨:
- 目前模型仍依赖于现成的 2D Flow 教师模型(如 UFM)生成伪标签,如果教师模型在特定领域出错,会引入噪声。
- 在处理极度复杂的独立多物体运动场景时,因子化机制仍有提升空间。
未来展望: 随着视频生成模型(Sora 等)的大爆发,互联网上拥有近乎无限的合成与真实视频资源。Flow3r 为我们展示了一条通往“视觉世界模型”的可行路径:不再死磕昂贵的激光雷达标注,而是从像素的往复移动中感悟世界的几何真理。
