[CVPR 2026] DynVLA:超越文本逻辑,用“解耦动力学”重塑自动驾驶思维链
DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving
本文提出了 DynVLA,一种为自动驾驶设计的视觉-语言-动作(VLA)模型。它创新的引入了“动力学思维链”(Dynamics CoT)范式,通过预测紧凑的未来世界动力学 Token 来辅助动作生成,在 NAVSIM 和 Bench2Drive 等基准测试中达到了 SOTA 性能。
TL;DR
DynVLA 提出了一种全新的 Dynamics CoT 范式,它不再让模型在生成动作前“说废话”(Textual CoT)或者“画画”(Visual CoT),而是让模型先生成极简的、物理意义明确的动力学 Token。通过解耦自车与环境的运动状态,DynVLA 实现了极高的推理效率与安全性。
关键战绩:
- 性能 SOTA:NAVSIM 指标 PDMS 91.7,Bench2Drive 驾驶得分 88.34。
- 推理奇快:延迟仅 0.37s,是传统 Visual CoT 方法的 1/6。

1. 痛点深挖:为什么之前的 CoT 不够好?
在端到端自动驾驶(E2E AD)中,让模型“先思考再行动”已成共识。但目前的思维链(CoT)存在两大流派的硬伤:
- Textual CoT (语言流):用文字描述“前方有车,我要减速”。这虽然增加了可解释性,但文字是离散且粗粒度的,无法表达精细的物理世界轨迹对比,对避障等长尾场景(Safety-critical)帮助有限。
- Visual CoT (视觉流):先预测未来 2 秒的视频帧,再决定怎么开。这种方法虽然时空感知强,但“画图”太重了!模型会浪费大量算力在预测路边草坪的纹理或云朵的移动上,而这些与决策无关。
DynVLA 的直觉 (Insight):我们需要一种紧凑的、纯物理的中间表达——即“世界动力学(World Dynamics)”。它只需要几个 Token,就能告诉模型:路是往哪转的,旁边的车大概怎么走。
2. 核心架构:Dynamics Tokenizer 的解耦艺术
DynVLA 的核心贡献在于其 Dynamics Tokenizer,它不再盲目压缩图像,而是通过以下三个精妙设计提取“纯净”的动力学:
A. 自车与环境的显式解耦 (Decoupling)
驾驶场景的复杂性在于:画面变化可能是因为你在开(自车动力学),也可能是因为路人在跑(环境动力学)。DynVLA 引入了 Q_ego 和 Q_env 两组 Query,并增加了一个物理正则化项:用自车动力学 Token 必须能重建出真实的控制动作(GT Action)。这强制模型把自己的运动和环境的运动分离开来,避免了“分不清是谁在动”的物理歧义。
B. 跨视图一致性 (Cross-view Consistency)
模型不仅要能重建下一时刻的图像(Image),还要能重建俯视图(BEV)。这保证了所学习到的动力学 Token 具有真正的语义一致性,而不是简单的像素平移。
C. 结构化序列 SFT & RFT
在生成环节,模型遵循:[BOD] -> 动力学 Token -> [EOD] -> [BOA] -> 动作 Token。
不仅通过监督微调(SFT)学习人类经验,还引入了 GRPO (Group Relative Policy Optimization) 进行增强学习(RFT),直接优化轨迹安全性评分(PDMS),确保模型生成的推理不仅“合理”而且“安全”。

3. 实验结果:速度与质量的双重飞跃
性能对垒
在 NAVSIM 榜单上,DynVLA 以 91.7 的高分领跑,显著优于传统的端到端方法(如 UniAD, VADv2)以及其他 VLA 基准(如 DriveVLA-W0)。更重要的是,它在处理交互场景时展现出了极强的自适应能力。

效率革命
相比于 Visual CoT 动辄 2 秒以上的延迟,DynVLA 将延迟降至 0.37 秒。这意味着它具备了在真实车辆上进行实时部署的潜力,真正解决了 VLA 模型“想太久”的问题。
4. 深度洞察:动力学 Token 到底学到了什么?
作者做了一个非常硬核的实验:动力学迁移 (Transferability)。 把场景 A 中由于“前车急刹”生成的动力学 Token,强行喂给场景 B 的模型。结果发现:场景 B 里的车也学会了急刹!这证明这些 Token 已经成了可移植的物理规律,而不是简单的统计关联。

定性案例分析:
- 意图感知:当模型推理出前车将要停止(动力学 Token 指示),它会自动规划减速,避免了无 CoT 模型常见的追尾。
- 道路几何感知:即使在视线受阻的弯道,动力学 Token 也能预示道路边界的演变,引导模型平滑过弯。
5. 总结与展望
DynVLA 的成功标志着自动驾驶 VLA 模型正在从“黑盒预测”转向“物理推演”。
局限性:虽然 Dynamics CoT 极大地提升了效率,但如果动力学预测出错(例如在极端恶劣天气下),错误会顺着思维链传播。 未来启示:未来的研究方向可能是将这种“慢速思维”(动力学推理)与“快速反应”(轻量级避障)结合,构建类似人类驾驶员的快慢双系统架构。
Senior Editor's Note: DynVLA 最值得称道的地方在于其对“简洁”的追求。在 LLM/VLM 规模不断膨胀的今天,这篇论文提醒我们:对于物理世界的建模,有物理意义的低维抽象(Decoupled Dynamics)往往比高维像素重建更有力。
