鲁棒性进阶:自监督骨骼表示学习如何挽救遮挡下的轨迹预测?
Robust Human Trajectory Prediction via Self-Supervised Skeleton Representation Learning
本文提出了基于自监督人体骨骼表示学习(Self-supervised Skeleton Representation Learning)的鲁棒轨迹预测方法。通过在预训练阶段引入掩码自编码器(Masked Autoencoding),增强了模型在真实场景下应对骨骼关键点缺失(如遮挡导致)的能力,显著提升了低到中等缺失率下的 SOTA 轨迹预测精度。
TL;DR
在自动驾驶和视频监控中,预测行人的未来轨迹至关重要。虽然加入“骨骼姿态”能让 AI 读懂行人的意图(比如要转身或起跑),但在现实中,遮挡导致的骨骼关键点丢失常让模型“瞬间致盲”。本文提出了一种基于自监督掩码自动编码器 (MAE) 的两阶段学习框架,通过预训练让编码器在关键点缺失 50% 的情况下依然能提取出稳定的运动特征。
核心痛点:精度与鲁棒性的“跷跷板”
在轨迹预测领域,研究者们发现单纯依靠历史坐标(Trajectory)很难判断行人的细微意图。引入骨骼序列(Skeleton)原本是解决该问题的“银弹”,但现实骨感:
- 脆弱性:一旦行人被路灯、车辆或其他行人遮挡,骨骼点就会丢失。
- 性能崩塌:现有的 SOTA 模型如 Social-TransMotion 在完整数据上表现出色,但面对缺失数据时 FDE 指标会从 0.17m 飙升至 0.87m(见下图)。
- 权衡难题:如果模型在训练时见过受损数据,它会变得“保守”,在数据完美时反而不如普通模型表现好。
Figure 1: 遮挡导致的骨骼缺失会使 FDE 误差急剧增加。
方法论:用自监督预训练筑起防御墙
作者给出的方案不是简单的“补点”,而是在表示学习 (Representation Learning) 层面解决问题。
1. 两阶段框架设计
第一阶段(图 2 右侧),使用 ST-GCN (Spatio-Temporal Graph Convolutional Network) 作为编码器,故意遮掉(Mask)一部分关节,让模型尝试重建。这迫使编码器学习人体结构的内在逻辑和运动趋势,而不是单纯记忆坐标。
第二阶段,将这个预训练好的编码器“冻结”并嵌入到轨迹预测模型中。此时,骨骼输入即使有缺失,编码器输出的“高阶特征”依然保持稳定。
Figure 2: 掩码自监督训练过程。
2. 多样化的掩码策略
为了模拟真实世界的复杂性,作者设计了三种掩码模式:
- Temporal Consistent Mask:模拟长期遮挡(如行人走在柱子后)。
- Random Mask:模拟随机检测失效。
- Body-Part Mask:模拟局部肢体完全被挡住。
实验发现,50% 的随机采样掩码在各种测试场景下的泛化能力最强。
实验战绩:超越基线的稳准狠
在 JTA 大型合成数据集上的测试结果令人振奋:
- 在“干净”环境下:我们的方法 ADE 为 0.898,甚至优于标准基线(0.920),打破了“拟合受损数据会降低清洁精度”的魔咒。
- 在中等缺失下 (40% 缺失率):预测误差仅小幅增长,且依然显著优于其他所有变体模型。
Figure 3: 整体架构:骨骼编码通过 Cross-Modality Transformer 与轨迹特征深度融合。
深度诊断:强依赖带来的高回报
通过“禁用骨骼模态”的消融实验(Ablation Study),作者揭露了一个有趣的现象:本文提出的方法比普通模型更依赖骨骼信息。
- 普通模型在骨骼失效时 ADE 增加 0.643。
- 本文方法在骨骼失效时 ADE 增加 1.491。
这说明该方法真正挖掘出了骨骼中的“含金量”。正是因为模型学会了如何在高噪声下提取这些高价值信息,它才能在拐弯等复杂预测场景下表现得远超前人(见下图可视化)。
Figure 4: 弯道场景下,只有本文方法(Ours)成功利用骨骼姿态预测出了拐弯趋势。
结论与启示
这篇论文对于工业界(如机器人导航、智慧安防)有很强的落地参考意义。它告诉我们:面对下游场景中不可避免的传感器中断或噪声,最优雅的解法不是在末端去‘修补’,而是在感知的上游通过自监督学习建立起具有 Inductive Bias (归纳偏置) 的鲁棒表示。
虽然在缺失率超过 60% 的极端场景下,所有模型的精度都会不可避免地下降(毕竟这就是个病态问题),但在绝大多数现实遮挡情况下,这套框架已经展现出了极强的生命力。
