[CVPR 2025(?)] LFG:大规模无标注视频预训练,让自动驾驶预测成为“免费的午餐”

Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos

总结
问题
方法
结果
要点
摘要

本文提出了 LFG (Learning to drive is a Free Gift),一种面向自动驾驶的零样本、无标签视频预训练框架。该方法通过一个统一的因果自回归架构,从互联网上海量的无标注单目驾驶视频中学习场景的几何、语义及运动信息的 pseudo-4D 表示,在 NAVSIM 规划任务上刷新了单摄像头输入的 SOTA 纪录。

TL;DR

自动驾驶领域的“GPT时刻”是否已经到来?本文提出的 LFG (Learning to drive is a Free Gift) 给出了肯定的信号。它直接利用互联网上数以百万计的无标注、甚至没有位姿(unposed)的驾驶视频进行预训练。通过一个自回归架构,LFG 能够学会“脑补”未来的场景几何、语义和动态物体运动。在不依赖 LiDAR 的情况下,LFG 仅靠单个摄像头就在 NAVSIM 规划任务中超越了众多重型多模态模型。

背景定位:从“手工标注”转向“大规模视频挖掘”

当前的自动驾驶模型(如 UniAD, Hydra-MDP)虽然性能强劲,但其训练过程极度依赖高精地图、LiDAR 点云和人类专家的轨迹标注。相比之下,人类驾驶员只需观察视觉光流和物体运动即可做出判断。

LFG 的核心直觉是:如果一个模型能准确预测视频的下一帧(包括深度、位姿和语义),那么它必然已经掌握了驾驶所需的核心特征。 这种将预训练视为“预测未来”的思想,正是大模型(LLM)取得成功的关键。

核心机制:Pseudo-4D 表示与多老师引导

LFG 的架构由三部分组成:

  1. 特征编码器:基于 DINOv2 和 π3 模型,将原始图像转换为潜在场景 Token。
  2. 因果自回归 Transformer (TAR):这是 LFG 的大脑,它根据过去的 Token 生成未来 M 帧的预测 Token。
  3. 多模态解码器:将生成的 Token 转换回 3D 点云、相机位姿、语义分割图和动态运动掩码。

LFG 模型架构图 图 1:LFG 架构示意图。通过因果 Transformer 实现对未来几何、语义和运动的统一预测。

无标签如何学习?—— Teacher-Student 蒸馏方案

为了在没有人工标注的情况下训练这么多模态,作者巧妙地引入了多个“老师”:

  • 几何老师 (π3):提供点云和相机位姿的伪监督。
  • 语义老师 (SegFormer):基于 Cityscapes 预训练模型提供场景分类指导。
  • 运动老师 (SAM2 + CoTracker3):通过跟踪物体的 2D 轨迹并映射回 3D 空间,自动识别出哪些物体在动,哪些是静止的。

运动掩码生成流程 图 2:运动掩码生成流水线。将 SAM2 的分割与 CoTracker3 的跟踪结合,实现全自动的运动监督信号提取。

实验战绩:规划性能的降维打击

LFG 在 NAVSIM 规划基准 上的表现令人惊叹。在只使用 front-view 单摄像头的情况下,它的 PDMS 分数达到了 85.2,直接“踢馆”了那些装备了 LiDAR 和 6 个摄像头的 BEV 模型。

惊人的数据效率

对比实验显示,LFG 展示了极强的 Sample Efficiency

  • 10% 标注数据:LFG 的表现(81.4)就足以抗衡使用 100% 数据 的常规模型。
  • 泛化能力:由于其预训练数据来自真实的 OpenDV YouTube 视频集,它在处理各种极端天气和复杂路况时表现出极强的鲁棒性。

NAVSIM 实验结果对比 表 1:LFG 在不同数据量下的规划性能。可见 LFG 在小样本(1%, 10%)下具有压倒性优势。

深度洞察:为什么“预测未来”对规划有用?

在自动驾驶中,规划(Planning)本质上是在寻找一个不与未来障碍物重叠的安全轨迹。 LFG 的消融实验(Ablation Study)表明,自回归头 (Autoregressive head)语义/运动监督 是不可或缺的。如果去掉这些模块,模型对于动态物体的处理能力就会大幅下降。通过预训练,LFG 的编码器不仅看到了“现在有什么”,还隐式地理解了“这个球可能会滚到路中间”这种物理直觉。

语义预测可视化 图 3:即便没有当前帧的图像输入(虚线框部分),LFG 也能准确预测未来的语义布局,说明其捕捉到了场景的动态演化。

局限性与展望

尽管 LFG 表现优异,但它目前仅预测短时(3-6 帧)的未来。此外,目前主要针对单目视频优化。作者指出,未来随着更多如 PhysicalAI 等多视角视频数据集的出现,LFG 可以扩展到全景视觉,从而进一步提升在复杂路口等场景下的表现。

总结

LFG 证明了:自动驾驶的知识确实可以从海量视频中作为“免费礼物”获得。这种 label-free 的预训练范式,为构建能够真正理解物理世界的自动驾驶基础模型(Foundational Models for Autonomy)开辟了新的道路。

发现相似论文

试试这些示例

  • 查找最近一年中利用大规模 YouTube 驾驶视频进行自监督预训练的自动驾驶算法及其性能对比。
  • 调研 π3 几何模型与 VGGT (Visual Geometry Grounded Transformer) 的理论继承关系及其在 3D 场景重建中的改进细节。
  • 探索如何将 LFG 提出的 pseudo-4D 表示应用于需要动态物体建模的 4D Gaussian Splatting 生成任务中。
目录
[CVPR 2025(?)] LFG:大规模无标注视频预训练,让自动驾驶预测成为“免费的午餐”
1. TL;DR
2. 背景定位:从“手工标注”转向“大规模视频挖掘”
3. 核心机制:Pseudo-4D 表示与多老师引导
3.1. 无标签如何学习?—— Teacher-Student 蒸馏方案
4. 实验战绩:规划性能的降维打击
4.1. 惊人的数据效率
5. 深度洞察:为什么“预测未来”对规划有用?
6. 局限性与展望
7. 总结