[Real-World E2E] Hyper Diffusion Planner:释放扩散模型在实车自动驾驶中的潜力
Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving
本文提出了 Hyper Diffusion Planner (HDP),这是一个面向端到端自动驾驶(E2E AD)的扩散模型规划框架。通过系统性研究扩散损失空间、轨迹表示及数据缩放,并结合强化学习(RL)后训练,该模型在 200 公里的真实道路测试中实现了比基准模型高 10 倍的性能提升。
TL;DR
清华大学 AIR 院与小米汽车联合推出的 Hyper Diffusion Planner (HDP) 填补了扩散模型在实车、闭环、超大规模数据端到端规划领域的空白。通过重新梳理 Diffusion 的设计范式,HDP 在 200 公里真实路测中表现惊人,性能直接翻了 10 倍。
背景定位:从仿真走向街头
尽管 Diffusion Models 在生成领域大放异彩,但在自动驾驶规划中,它们常被困在仿真器里。真实世界的端到端规划面临三大难关:
- 维度差异:轨迹是低维流形,不像图片是高维感知数据。
- 安全红线:模仿学习学得再像,也难保在极端情况下不“撞车”。
- 平滑噩梦:离散的坐标点预测往往导致车辆在现实中疯狂抖动(Jerk)。
痛点深挖:为什么之前的 Diffusion Planner 不够好?
作者通过消融实验发现,大家常用的 -prediction(预测噪声)在高频信号丢失严重时会导致轨迹抖动。更致命的是,单纯预测坐标点(Waypoints)虽然 ADE 低,但速度分布极其不稳;而单纯预测速度(Velocity),虽然开起来顺滑,但空间精度又不够。
此外,由于主流学术数据集(如 NAVSIM)规模只有 100K 左右,导致 Diffusion 陷入了 Mode Collapse,无法展现其真正的多模态生成天赋。
方法论详解:HDP 的三大核心支柱
1. 损失空间重构:Back to Basics
研究表明,对于轨迹这种低维数据,τ0-prediction(直接预测原始轨迹)配合 τ0-loss 效果远好于传统的预测噪声。它不仅收敛极快,且在低噪声阶段表现更稳,生成的轨迹具有更强的运动学一致性(Kinematic Coherence)。
2. 轨迹表征的平衡艺术:Hybrid Loss
为了兼顾“准”与“顺”,HDP 提出了混合损失函数。模型输出速度(Velocity),但在训练时同时对坐标点和速度进行监督。
作者在数学上证明了这种混合损失依然等价于一种加权的变分边界(Score Matching),不会偏离最优解。
HDP 架构:采用了 Transformer 为核心的扩散解码器,融合了感知生成的 OD/LD Tokens。
3. 数据缩放(Scaling Law)的涌现
本文最令人兴奋的发现是:扩散模型在驾驶领域也有 Scaling Law。当数据从 100K 级别跨越到 20M 甚至 70M 级别时,模型从单一模式进化到了自发的多模态(如同时能学出绕行与跟车两种决策)。
实验与结果:十倍性能的飞跃
在包含复杂城区场景的测试中,HDP 展示了出色的表现。
- 实车战绩:相比于基础版本,加入 Hybrid Loss 和大规模数据后的 HDP 在闭环成功率和稳定性上实现了量级跨越。
- RL 微调:通过 RL Post-training,模型在安全性(如避让行人、防止切入)上得到了进一步强化。
表:随着技术模块(Hybrid Loss, Data Scaling, RL)的叠力,模型得分稳步攀升。
HDP 在变道避让超大卡车及无保护左转中的从容表现。
深度洞察与总结
核心价值
HDP 证明了:不要过度工程化,保持框架简洁,让数据和扩散模型本身的分布拟合能力去解决问题。 它是工业界大规模数据赋能 Diffusion 的一个极佳范本。
局限性与未来
- 效率与延迟:尽管使用了 DPM-Solver 优化,扩散模型的多步迭代对比直出模型(One-step)仍有计算开销。
- 奖励函数的复杂性:目前的 RL 阶段主要针对安全性,如何平衡“安全”与“驾驶效率”(不当老司机也不当马路杀手)仍是待解决的博弈难题。
HDP 的出现标志着端到端自动驾驶进入了一个新阶段:由传统的判定式回归向生成式概率分布建模的全面转型。
