[ICCV 2025] RaWMPC:从“模仿专家”到“理解风险”,开启端到端自动驾驶的零监督进化
Risk-Aware World Model Predictive Control for Generalizable End-to-End Autonomous Driving
本文提出了 RaWMPC,一种无需专家行为监督的端到端自动驾驶(E2E-AD)框架。通过结合风险感知世界模型(World Model)与模型预测控制(MPC),该方法在 Bench2Drive 和 NAVSIM 榜单上均取得 SOTA 成绩,显著提升了模型在长尾危险场景下的泛化能力。
TL;DR
传统的端到端自动驾驶往往陷入“画虎画皮难画骨”的境地——模型拼命模仿专家的行驶轨迹,却从未真正理解“碰撞”意味着什么。来自特伦托大学和中山大学的研究团队提出了 RaWMPC,一种基于风险感知世界模型预测控制的新框架。它彻底摆脱了对人类专家动作标签的依赖,通过主动在模拟中“试错”,学会了预测风险并在毫秒级内选择最优避险路径。
背景定位:这是该领域从“行为克隆(Behavior Cloning)”向“基于模型的强化学习(MBRL)”深度迈进的标志性工作,重点解决了长尾场景下的泛化难题。
1. 痛点:专家没教过的,模型就不会跑?
目前 E2E-AD 的主流范式是模仿学习(IL)。其局限性显而易见:
- 数据的枯竭:专家演示通常只包含安全的路径。对于“如果我冲上人行道会发生什么”这种危险行为,模型缺乏负样本监管。
- 泛化性断崖:遇到从未见过的暴雨、突发事故等长尾场景,模型往往会因“由于没见过这类轨迹而不知所措”,产生危险的决策。
- 黑盒属性:直接输出一个 Action,缺乏“为什么要这么开”的解释性。

2. Methodology:如何让世界模型“懂点风险”?
2.1 架构设计
RaWMPC 的核心在于一个世界模型 。在每个时间步,它接收候选动作序列 ,并递归预测未来的隐状态 。 为了让预测结果可评估,作者设计了三个解码器:
- 语义分割(Segmentation):理解环境中的道路、行人、车辆等静态/动态物体。
- 语义引导事件预测(Event Decoder):这是灵魂所在。它利用分割图的 Attention 引导,预测是否会发生“碰撞”、“违规”等事件。
- 状态预测(Ego-state):预测未来的车速与位置。

2.2 风险感知交互策略(Risk-aware Interaction)
为了让世界模型见过“世面”,作者提出了三类采样模式:
- Rand:随机探索动作空间。
- Bad:利用当前模型自评估出的“高代价”动作进行交互,专门收集撞车、违章的负样本。
- Good:执行低代价动作,巩固安全驾驶行为。 这种策略使得模型能够在没有专家演示的情况下,通过“被蛇咬后的痛感”学会什么是“井绳”。
2.3 自评估蒸馏:从预测到实时控制
MPC(模型预测控制)虽然精准,但在推理时对成千上万个动作序列进行 Rollout 极其耗时。RaWMPC 巧妙地将世界模型的“评估眼光”通过 InfoNCE 损失函数蒸馏给一个 cVAE 动作提议网络。这样,提议网络在测试时能直接生成高质量的候选动作,大大提升了推理效率。
3. 实验战绩:不靠专家也能拿第一
在 Bench2Drive 这一严苛的闭环测试中,RaWMPC 在完全不使用专家预热数据(0% Warm-up)的情况下,DS(驾驶得分)达到 87.34,直接击败了训练了完整专家数据的 HiP-AD 和 SimLingo 等 SOTA 模型。

极端场景的可视化
如下图所示,在面对横穿马路的行人或复杂的左转场景时,RaWMPC 的世界模型能够预测出“直行会碰撞”的后果,从而在多个候选路径中精准选出先减速避让、再择机汇入的最佳策略。

4. 深度洞察:为什么 RaWMPC 更强?
- 本能般的防御驾驶:模仿学习在域偏移(如晴天转雨天)时往往失效,因为视觉特征变了。但 RaWMPC 学习的是“风险原则”——只要预测到前方物体有重叠风险,无论视野如何,都会触发减速逻辑。
- 长视角的代价函数:论文发现规划长度 (约 4 秒)是最佳平衡点。太短看不见延迟危险,太长则会因为世界模型的累积误差导致决策漂移。
5. 局限性与展望
尽管精度傲视群雄,但 RaWMPC 的实时性以及在复杂城市多车博弈场景下的精确建模仍有优化空间。研究团队表示,未来将探索更高效的动态规划算法以及 Sim-to-Real 的物理一致性迁移。
总结:RaWMPC 告诉我们,自动驾驶的终局也许不是“模仿人”,而是“理解物理规律与风险边界”。
