[Real-World E2E] Hyper Diffusion Planner:释放扩散模型在实车自动驾驶中的潜力

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

总结
问题
方法
结果
要点

本文提出了 Hyper Diffusion Planner (HDP),这是一个面向端到端自动驾驶(E2E AD)的扩散模型规划框架。通过系统性研究扩散损失空间、轨迹表示及数据缩放,并结合强化学习(RL)后训练,该模型在 200 公里的真实道路测试中实现了比基准模型高 10 倍的性能提升。

TL;DR

清华大学 AIR 院与小米汽车联合推出的 Hyper Diffusion Planner (HDP) 填补了扩散模型在实车、闭环、超大规模数据端到端规划领域的空白。通过重新梳理 Diffusion 的设计范式,HDP 在 200 公里真实路测中表现惊人,性能直接翻了 10 倍。

背景定位:从仿真走向街头

尽管 Diffusion Models 在生成领域大放异彩,但在自动驾驶规划中,它们常被困在仿真器里。真实世界的端到端规划面临三大难关:

  1. 维度差异:轨迹是低维流形,不像图片是高维感知数据。
  2. 安全红线:模仿学习学得再像,也难保在极端情况下不“撞车”。
  3. 平滑噩梦:离散的坐标点预测往往导致车辆在现实中疯狂抖动(Jerk)。

痛点深挖:为什么之前的 Diffusion Planner 不够好?

作者通过消融实验发现,大家常用的 -prediction(预测噪声)在高频信号丢失严重时会导致轨迹抖动。更致命的是,单纯预测坐标点(Waypoints)虽然 ADE 低,但速度分布极其不稳;而单纯预测速度(Velocity),虽然开起来顺滑,但空间精度又不够。

此外,由于主流学术数据集(如 NAVSIM)规模只有 100K 左右,导致 Diffusion 陷入了 Mode Collapse,无法展现其真正的多模态生成天赋。


方法论详解:HDP 的三大核心支柱

1. 损失空间重构:Back to Basics

研究表明,对于轨迹这种低维数据,τ0-prediction(直接预测原始轨迹)配合 τ0-loss 效果远好于传统的预测噪声。它不仅收敛极快,且在低噪声阶段表现更稳,生成的轨迹具有更强的运动学一致性(Kinematic Coherence)。

2. 轨迹表征的平衡艺术:Hybrid Loss

为了兼顾“准”与“顺”,HDP 提出了混合损失函数。模型输出速度(Velocity),但在训练时同时对坐标点和速度进行监督。

作者在数学上证明了这种混合损失依然等价于一种加权的变分边界(Score Matching),不会偏离最优解。

模型架构图 HDP 架构:采用了 Transformer 为核心的扩散解码器,融合了感知生成的 OD/LD Tokens。

3. 数据缩放(Scaling Law)的涌现

本文最令人兴奋的发现是:扩散模型在驾驶领域也有 Scaling Law。当数据从 100K 级别跨越到 20M 甚至 70M 级别时,模型从单一模式进化到了自发的多模态(如同时能学出绕行与跟车两种决策)。


实验与结果:十倍性能的飞跃

在包含复杂城区场景的测试中,HDP 展示了出色的表现。

  • 实车战绩:相比于基础版本,加入 Hybrid Loss 和大规模数据后的 HDP 在闭环成功率和稳定性上实现了量级跨越。
  • RL 微调:通过 RL Post-training,模型在安全性(如避让行人、防止切入)上得到了进一步强化。

实验结果对比 表:随着技术模块(Hybrid Loss, Data Scaling, RL)的叠力,模型得分稳步攀升。

场景展示 HDP 在变道避让超大卡车及无保护左转中的从容表现。


深度洞察与总结

核心价值

HDP 证明了:不要过度工程化,保持框架简洁,让数据和扩散模型本身的分布拟合能力去解决问题。 它是工业界大规模数据赋能 Diffusion 的一个极佳范本。

局限性与未来

  • 效率与延迟:尽管使用了 DPM-Solver 优化,扩散模型的多步迭代对比直出模型(One-step)仍有计算开销。
  • 奖励函数的复杂性:目前的 RL 阶段主要针对安全性,如何平衡“安全”与“驾驶效率”(不当老司机也不当马路杀手)仍是待解决的博弈难题。

HDP 的出现标志着端到端自动驾驶进入了一个新阶段:由传统的判定式回归向生成式概率分布建模的全面转型。

发现相似论文

试试这些示例

  • 查找最近一年内将扩散模型(Diffusion Models)应用于实车闭环自动驾驶规划(End-to-End Planning)的其他方法及其由于安全问题采取的策略。
  • 哪篇论文最早探讨了扩散模型在低维流形(Low-dimensional Manifold)数据生成中的损失函数选择,本文提到的 τ0-loss 优越性是否有理论支撑?
  • 调研目前在端到端自动驾驶中,除了强化学习(RL)之外,还有哪些方法可以有效地解决模仿学习(IL)带来的累积误差(Error Accumulation)问题?
目录
[Real-World E2E] Hyper Diffusion Planner:释放扩散模型在实车自动驾驶中的潜力
1. TL;DR
2. 背景定位:从仿真走向街头
3. 痛点深挖:为什么之前的 Diffusion Planner 不够好?
4. 方法论详解:HDP 的三大核心支柱
4.1. 1. 损失空间重构:Back to Basics
4.2. 2. 轨迹表征的平衡艺术:Hybrid Loss
4.3. 3. 数据缩放(Scaling Law)的涌现
5. 实验与结果:十倍性能的飞跃
6. 深度洞察与总结
6.1. 核心价值
6.2. 局限性与未来