[arXiv 2026] LAD-Drive: 意图与执行的华丽解耦,扩散 Transformer 赋能 LLM 驾驭复杂交通
LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers
本文提出了 LAD-Drive,一个将多模态大语言模型(MLLM)与扩散 Transformer 结合的端到端自动驾驶框架。该方法通过引入动作解码器推断概率元动作分布,并配合轻量化扩散解码器,在 LangAuto 基准测试中实现了 Driving Score 59% 的大幅提升。
TL;DR
在自动驾驶领域,如何将 LLM 强大的语义推理能力转化为平滑、安全的物理轨迹一直是个难题。传统的“离散对连续”映射往往导致车辆在十字路口“犹豫不决”或产生违背物理定律的动作。LAD-Drive 通过一种创新的结构化解耦方案,将高层语义意图(做什么)与底层空间规划(怎么做)分开,利用动作感知扩散 Transformer (Diffusion Transformer) 在短短 2 个去噪步骤内生成高质量轨迹,在 LangAuto 基准上刷新了 SOTA 记录。
痛点深挖:语义推理与物理执行的“断层”
目前基于 MLLM 的自动驾驶系统通常有两条路线,但都存在明显的“硬伤”:
- 直接预测路线点:将坐标作为文本 Token 输出。这会导致严重的模态失配,产生的轨迹往往不连续甚至格式错误。
- 耦合回归头:虽然效率高,但 L1/L2 损失函数在处理“左转还是右转”的多峰决策时会产生“均值模糊”,导致车辆撞向中间障碍物。
- One-hot 编码的局限:现有的条件生成方法通常给出一个固定的动作标签(如“左转”),掩盖了环境中的不确定性。

核心贡献:解耦意图与空间规划
LAD-Drive 的架构之美在于其“三步走”的优雅逻辑:
1. 动作解码器(Action Decoder):构建“信念状态”
模型不再仅仅依赖隐晦的 LLM 特征,而是显式地预测一个侧向动作的概率分布(如 Lane Follow, Left, Right 等)。这个分布形成了一个“信念状态”(Belief State),能够保留导航过程中的细微不确定性。
2. 特征瓶颈(Feature Bottleneck):过滤“语义噪声”
作者发现,LLM 的 4096 维隐藏状态包含了大量对规划无关的语言背景噪声。直接输入扩散模型会导致性能崩溃(DS 从 68.2 跌至 48.5)。LAD-Drive 引入了一个 512 维的瓶颈层,强制模型进行信息压缩,仅保留最关键的导航意图和空间语义。
3. 动作感知扩散解码器(Diffusion Decoder)
相比于从纯高斯噪声开始去噪,LAD-Drive 使用了**K-means 聚类提取的领域对齐锚点(Domain-aligned Anchors)**作为先验。
- 双重注意机制:先通过交叉注意力挂载 LLM 场景上下文,再挂载“车辆状态+动作意图”组合向量。
- 极高效推理:仅需 2 步迭代即可完成轨迹优化,确保了端到端的实时性。

实验战绩:全方位的安全性提升
在 CARLA 模拟器的 LangAuto 挑战赛中,LAD-Drive 表现惊人:
- 驾驶得分 (DS):从基线的 42.9 提升至 68.2 (+59%)。
- 安全性:车辆碰撞率减少 76%,路面设施碰撞减少 72%。
- 路线遵循:路线偏离(Route Deviation)从 11.95 骤减至 2.31,解决了 LLM 驾驶中常见的“转错弯”问题。

消融实验的关键发现 (Insights)
实验表明,单纯增加侧向意图或单纯增加车辆状态(Ego-status)提升有限。只有当两者结合时,模型才能既知道“往哪走”又知道“怎么稳着走”。另外,引入纵向动作预测反而会降低性能,这说明纵向动力学更依赖物理空间感知,而非高层语义指令。
深度洞察与总结
LAD-Drive 为 LLM 进入物理世界提供了一个教科书级的参考:不要试图让 LLM 包揽一切,而是将其作为提供“指导性概率”的大脑,配合擅长处理多峰分布的扩散模型作为“小脑”进行物理精炼。
其引入的特征瓶颈层(Feature Bottleneck)解决了一个被学术界长期忽视的问题:即 LLM 的表征维度对于下游控制任务可能存在“维度灾难”和噪声干扰。
展望未来:虽然 LAD-Drive 在模拟器中表现卓越,但其泛化到真实世界长尾场景的能力仍需进一步验证。此外,如何将更复杂的动态障碍物占用图(Occupancy Map)整合进这个轻量化的扩散框架,将是下一个技术制高点。
