[ICRA 2025] NOVA:将 3D 多目标跟踪重构为 LLM 自回归生成的全新范式

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

总结
问题
方法
结果
要点
摘要

本文提出了 NOVA,一种用于自动驾驶 3D 多目标跟踪(3D MOT)的下一时刻开集自回归(Next-step Open-Vocabulary Autoregression)范式。该方法将传统的基于距离的手写匹配规则转化为基于大语言模型(LLM)的序列生成任务,有效解决了开集场景下未知类别的跟踪难题。

TL;DR

传统的 3D 多目标跟踪(3D MOT)在面对从未见过的“新物种”时往往束手无策。来自南方科技大学、东京大学等机构的研究者提出了 NOVA,这是一种跳出“检测-匹配”传统框架的新范式。它将跟踪任务看作是一个“完形填空”问题:基于已有的轨迹序列,利用轻量级 LLM(Qwen2.5-0.5B)自回归地预测下一个目标是否匹配。在 nuScenes 榜单上,NOVA 对新类别的跟踪性能提升了惊人的 20.21%

背景定位:为何传统 3D MOT 在开集环境下会失效?

在真实世界的自动驾驶场景中,长尾分布和未知物体是常态。传统的 3D MOT 依赖于:

  1. 闭集检测器:对没见过的东西(如奇形怪状的工程车、特种车)直接过滤。
  2. 硬编码匹配:如卡尔曼滤波配合匈牙利算法。

当检测器勉强输出一个“新类别”目标时,其几何中心往往在抖动,语义标签也在不断跳变(一会儿是 Bus,一会儿是 Truck)。这种“噪声极大”的输入会让传统的距离匹配机制彻底崩溃,导致频繁的 ID Switch 或轨迹中断。

核心动机:从“匹配”到“推理”

作者认为,开集跟踪的核心挑战是在不确定性中保持长程逻辑一致性。人类在观察目标时,不仅看距离快慢,还会结合语义常识。NOVA 的核心 Insight 是:轨迹本质上是一段有序的“时空语义句子”。如果能利用 LLM 强大的序列建模和逻辑推理能力,就能在语义模糊时,通过运动连续性和高维语义先验来“推理”出正确的匹配关系。

NOVA 架构解析

NOVA 的工作流分为三个关键技术节点,旨在将凌乱的 3D 坐标转化为 LLM 能读懂的语言:

1. 几何编码器 (Geometry Encoder) 与 IoU 辅助头

直接把 3D 坐标 (x, y, z) 变成文本字符串(如 "1.23, 4.56")会面临分词器的精度损失。NOVA 引入了一个专用的 Geometry Encoder,将 9 维的 Bbox 特征映射到 LLM 的词嵌入空间中。为了增加其对噪声的鲁棒性,还加入了一个辅助任务:预测预测框与真值的 IoU 质量,这起到了正则化的作用。

NOVA 模型架构图

2. 混合提示 (Hybrid Prompting)

为了防止模型过度依赖已知的“汽车”、“行人”等标签(语义过拟合),NOVA 在训练时玩了个“障眼法”:

  • 已知类:保留真实标签。
  • 新类别:统一替换为 Unknown。 这种策略逼迫 LLM 学会:即使不知道这东西叫什么,也要根据它在空中的姿态和运动规律来判定它是不是之前的那个目标。

3. 难负样本挖掘 (Hard Negative Mining)

在拥挤路口的跟踪难点在于“长得像且靠得近”的目标。NOVA 抛弃了随机采样,专门挑选空间位置邻近但身份不同的目标作为负样本,训练 LLM 在极高干扰下的细粒度判别力。

实验战绩:新类别识别的飞跃

NOVA 在 nuScenes、V2X-Seq-SPD 和 KITTI 三大基准上展现了绝对的优势。

类别 (Category)方法 (Method)AMOTA (↑)MOTA (↑)
Novel (新类)Open3DTrack2.202.70
Novel (新类)NOVA (Ours)22.41 (+20.21)19.60

此外,消融实验显示:模型并非越大越好。使用 0.5B 参数的 Qwen2.5 在性能和实时性(3.4 FPS)上达到了最佳平衡。这说明对于 3D 轨迹这种相对“精炼”的序列信息,超大规模参数反而可能导致推理迟钝。

定性结果对比 在复杂场景中,NOVA(下方行)相比传统方法显著减少了 ID Switch 和类别跳变现象。

总结与价值

NOVA 成功地将 3D MOT 从一个简单的“特征匹配”问题升华为一个“上下文推理”问题。其价值在于:

  • 解耦了检测与匹配:即使上游检测器不完美,下游的生成式匹配也能“通过脑补”维持轨迹。
  • 极强的泛化性:在未知类别上的突破性表现,为自动驾驶系统处理“黑天鹅效应”提供了新思路。

局限性:目前 3.4 FPS 的推理速度距离完全实时还有一定差距,未来结合轻量化 Token 压缩或更高效的注意力机制将是工业化落地的关键。

发现相似论文

试试这些示例

  • 查找最近其他将大语言模型(LLM)应用于 3D 多目标跟踪或自动驾驶感知任务的 SOTA 论文。
  • 哪篇论文最早提出了 Open-Vocabulary 3D 目标检测的概念,本文在检测结果的利用上与其有何关联?
  • 调研当前除了自回归序列生成外,还有哪些主流方法在尝试解决自动驾驶中的开集(Open-World)感知挑战?
目录
[ICRA 2025] NOVA:将 3D 多目标跟踪重构为 LLM 自回归生成的全新范式
1. TL;DR
2. 背景定位:为何传统 3D MOT 在开集环境下会失效?
3. 核心动机:从“匹配”到“推理”
4. NOVA 架构解析
4.1. 1. 几何编码器 (Geometry Encoder) 与 IoU 辅助头
4.2. 2. 混合提示 (Hybrid Prompting)
4.3. 3. 难负样本挖掘 (Hard Negative Mining)
5. 实验战绩:新类别识别的飞跃
6. 总结与价值