[CVPR 2024] NORD:无需推理标注,不到 60% 数据即可训练高性能自动驾驶 VLA
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
本文提出了 NORD (No Reasoning for Driving),一种高效的视觉-语言-动作 (VLA) 自动驾驶模型。通过引入 Dr. GRPO 算法克服“难度偏见”,NORD 在完全不使用推理标注且仅使用不到 60% 训练数据的情况下,达到了与 SOTA 推理型模型相当的性能。
TL;DR
长期以来,学界普遍认为端到端自动驾驶模型(VLA)需要庞大的数据集和详尽的“推理思维链”(CoT)标注才能处理复杂场景。本文提出的 NORD (No Reasoning for Driving) 挑战了这一范式。它证明:通过使用 Dr. GRPO 算法解决强化学习中的“难度偏见”问题,我们可以在完全无推理标注、数据量消减 60% 的情况下,训练出性能媲美甚至超越 SOTA 的轻量级驾驶模型。
背景:为什么推理型模型变慢了?
当前的视觉-语言-动作(VLA)模型(如 AutoVLA)通常遵循“SFT(指令微调)+ RL(强化学习)”的路径。为了让模型学会在十字路口避让,开发者不得不喂入大量的文本:“看到前方有行人,我应该减速...”。
但这带来了三个问题:
- 标注贵:生成数万条高质量的驾驶逻辑描述极其耗时。
- 推理慢:在车端设备上,逐个生成推理 Token 会增加延迟。
- RL 优化难题:当 SFT 阶段数据不足(模型较弱)时,标准的强化学习算法(如 DeepSeek-R1 使用的 GRPO)在处理驾驶这种高方差、奖励稀疏的任务时,往往会失效。
核心洞察:GRPO 的“难度偏见”
作者发现,标准的 GRPO 在面对弱 SFT 模型时表现极差(仅提升 0.67%)。其物理直觉在于:
- 低方差陷阱:模型在过于简单(直行)或极难(注定碰撞)的样本上方差很小。
- 中等难度的信号消失:对于真正需要学习的复杂机动(如变道、切弯),模型输出不稳定,导致组内奖励方差巨大。
- 公式弊端:GRPO 的优势函数计算需要除以标准差。这导致那些最有学习价值(方差大)的样本,其梯度信号被严重衰减了。
图:GRPO 只能优化低方差区域(红/绿区),对高方差的中间区域束手无策。
方法论:NORD 架构与 Dr. GRPO
1. 极致精简的架构
NORD 基于 Qwen-2.5VL,采用多视图图像作为输入,直接输出 Action Token。它使用了 K-disc Tokenization 技术,将连续的轨迹聚类为 2048 个离散 Token。
- 输入:三路相机视频流 + 历史状态 + 驾驶指令。
- 输出:直接预测未来的坐标轨迹,跳过所有“废话”推理。

2. 引入 Dr. GRPO
为了让模型从数据稀疏的“弱基底”中成长,NORD 采用了 Dr. GRPO。核心改动非常简单但暴力:在优势函数计算中移除标准差分母。 这种做法确保了即使在“困难场景”下,模型也能获得足够强的学习信号,从而允许我们显著减少 SFT 阶段对大规模数据和推理标注的依赖。
实验结果:效率曲线的巅峰
NORD 在 NAVSIM 和 WaymoE2E 两个主流榜单上进行了验证:
- 数据效率:在 Waymo 任务中,NORD 仅用 1.2 万个样本,就击败了使用 17 倍数据量的 Poutine 模型。
- 性能增长:在使用 Dr. GRPO 优化后,NORD 从基座的 76.6 提升到了 85.6,而传统 GRPO 几乎原地踏步。
- 实时性:由于没有 Reasoning Tokens,推理频率大幅提升,完全满足实时的车端部署需求。
表:NORD 在 NAVSIM 上不仅在 PDMS 分数上领先,还保持了极佳的舒适度和安全性指标。
总结与思考
NORD 的出现为自动驾驶 VLA 模型指明了一个新方向:我们是否真的需要模型“一边开车一边写作文”? 论文给出的答案是否定的。通过更科学的强化学习训练方法,我们可以跳过昂贵的语言推理阶段,直接通过物理世界的反馈(奖励函数)来教模型开车。
局限性:尽管缓解了偏见,但模型在极其罕见的长尾场景中仍有失效可能。未来的研究可能会探讨如何将“慢思考”作为一种按需启动的功能,而非每帧必用的负担。
关键词:#CVPR2024 #NORD #VLA #自动驾驶 #DrGRPO #数据效率
