[CVPR 2024] NORD:无需推理标注,不到 60% 数据即可训练高性能自动驾驶 VLA

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

总结
问题
方法
结果
要点

本文提出了 NORD (No Reasoning for Driving),一种高效的视觉-语言-动作 (VLA) 自动驾驶模型。通过引入 Dr. GRPO 算法克服“难度偏见”,NORD 在完全不使用推理标注且仅使用不到 60% 训练数据的情况下,达到了与 SOTA 推理型模型相当的性能。

TL;DR

长期以来,学界普遍认为端到端自动驾驶模型(VLA)需要庞大的数据集和详尽的“推理思维链”(CoT)标注才能处理复杂场景。本文提出的 NORD (No Reasoning for Driving) 挑战了这一范式。它证明:通过使用 Dr. GRPO 算法解决强化学习中的“难度偏见”问题,我们可以在完全无推理标注数据量消减 60% 的情况下,训练出性能媲美甚至超越 SOTA 的轻量级驾驶模型。


背景:为什么推理型模型变慢了?

当前的视觉-语言-动作(VLA)模型(如 AutoVLA)通常遵循“SFT(指令微调)+ RL(强化学习)”的路径。为了让模型学会在十字路口避让,开发者不得不喂入大量的文本:“看到前方有行人,我应该减速...”。

但这带来了三个问题:

  1. 标注贵:生成数万条高质量的驾驶逻辑描述极其耗时。
  2. 推理慢:在车端设备上,逐个生成推理 Token 会增加延迟。
  3. RL 优化难题:当 SFT 阶段数据不足(模型较弱)时,标准的强化学习算法(如 DeepSeek-R1 使用的 GRPO)在处理驾驶这种高方差、奖励稀疏的任务时,往往会失效。

核心洞察:GRPO 的“难度偏见”

作者发现,标准的 GRPO 在面对弱 SFT 模型时表现极差(仅提升 0.67%)。其物理直觉在于:

  • 低方差陷阱:模型在过于简单(直行)或极难(注定碰撞)的样本上方差很小。
  • 中等难度的信号消失:对于真正需要学习的复杂机动(如变道、切弯),模型输出不稳定,导致组内奖励方差巨大。
  • 公式弊端:GRPO 的优势函数计算需要除以标准差。这导致那些最有学习价值(方差大)的样本,其梯度信号被严重衰减了。

难度偏见分析 图:GRPO 只能优化低方差区域(红/绿区),对高方差的中间区域束手无策。


方法论:NORD 架构与 Dr. GRPO

1. 极致精简的架构

NORD 基于 Qwen-2.5VL,采用多视图图像作为输入,直接输出 Action Token。它使用了 K-disc Tokenization 技术,将连续的轨迹聚类为 2048 个离散 Token。

  • 输入:三路相机视频流 + 历史状态 + 驾驶指令。
  • 输出:直接预测未来的坐标轨迹,跳过所有“废话”推理。

模型架构图

2. 引入 Dr. GRPO

为了让模型从数据稀疏的“弱基底”中成长,NORD 采用了 Dr. GRPO。核心改动非常简单但暴力:在优势函数计算中移除标准差分母 这种做法确保了即使在“困难场景”下,模型也能获得足够强的学习信号,从而允许我们显著减少 SFT 阶段对大规模数据和推理标注的依赖。


实验结果:效率曲线的巅峰

NORD 在 NAVSIM 和 WaymoE2E 两个主流榜单上进行了验证:

  • 数据效率:在 Waymo 任务中,NORD 仅用 1.2 万个样本,就击败了使用 17 倍数据量的 Poutine 模型。
  • 性能增长:在使用 Dr. GRPO 优化后,NORD 从基座的 76.6 提升到了 85.6,而传统 GRPO 几乎原地踏步。
  • 实时性:由于没有 Reasoning Tokens,推理频率大幅提升,完全满足实时的车端部署需求。

实验结果对比 表:NORD 在 NAVSIM 上不仅在 PDMS 分数上领先,还保持了极佳的舒适度和安全性指标。


总结与思考

NORD 的出现为自动驾驶 VLA 模型指明了一个新方向:我们是否真的需要模型“一边开车一边写作文”? 论文给出的答案是否定的。通过更科学的强化学习训练方法,我们可以跳过昂贵的语言推理阶段,直接通过物理世界的反馈(奖励函数)来教模型开车。

局限性:尽管缓解了偏见,但模型在极其罕见的长尾场景中仍有失效可能。未来的研究可能会探讨如何将“慢思考”作为一种按需启动的功能,而非每帧必用的负担。


关键词:#CVPR2024 #NORD #VLA #自动驾驶 #DrGRPO #数据效率

发现相似论文

试试这些示例

  • 查找最近其他关于如何缓解强化学习算法(如 GRPO 或 PPO)在处理非二元稀疏奖励时的“难度偏见”问题的研究论文。
  • 哪篇论文最早提出了 Dr. GRPO 算法,该算法在 LLM 数理推理以外的具身智能任务中还有哪些应用?
  • 调研目前自动驾驶领域中,除了思维链 (CoT) 以外,还有哪些利用视觉语言模型 (VLM) 提取环境语义但不增加推理延迟的方法?
目录
[CVPR 2024] NORD:无需推理标注,不到 60% 数据即可训练高性能自动驾驶 VLA
1. TL;DR
2. 背景:为什么推理型模型变慢了?
3. 核心洞察:GRPO 的“难度偏见”
4. 方法论:NORD 架构与 Dr. GRPO
4.1. 1. 极致精简的架构
4.2. 2. 引入 Dr. GRPO
5. 实验结果:效率曲线的巅峰
6. 总结与思考