鲁棒性进阶:自监督骨骼表示学习如何挽救遮挡下的轨迹预测?

Robust Human Trajectory Prediction via Self-Supervised Skeleton Representation Learning

总结
问题
方法
结果
要点

本文提出了基于自监督人体骨骼表示学习(Self-supervised Skeleton Representation Learning)的鲁棒轨迹预测方法。通过在预训练阶段引入掩码自编码器(Masked Autoencoding),增强了模型在真实场景下应对骨骼关键点缺失(如遮挡导致)的能力,显著提升了低到中等缺失率下的 SOTA 轨迹预测精度。

TL;DR

在自动驾驶和视频监控中,预测行人的未来轨迹至关重要。虽然加入“骨骼姿态”能让 AI 读懂行人的意图(比如要转身或起跑),但在现实中,遮挡导致的骨骼关键点丢失常让模型“瞬间致盲”。本文提出了一种基于自监督掩码自动编码器 (MAE) 的两阶段学习框架,通过预训练让编码器在关键点缺失 50% 的情况下依然能提取出稳定的运动特征。

核心痛点:精度与鲁棒性的“跷跷板”

在轨迹预测领域,研究者们发现单纯依靠历史坐标(Trajectory)很难判断行人的细微意图。引入骨骼序列(Skeleton)原本是解决该问题的“银弹”,但现实骨感:

  • 脆弱性:一旦行人被路灯、车辆或其他行人遮挡,骨骼点就会丢失。
  • 性能崩塌:现有的 SOTA 模型如 Social-TransMotion 在完整数据上表现出色,但面对缺失数据时 FDE 指标会从 0.17m 飙升至 0.87m(见下图)。
  • 权衡难题:如果模型在训练时见过受损数据,它会变得“保守”,在数据完美时反而不如普通模型表现好。

遮挡对轨迹预测精度的影响 Figure 1: 遮挡导致的骨骼缺失会使 FDE 误差急剧增加。

方法论:用自监督预训练筑起防御墙

作者给出的方案不是简单的“补点”,而是在表示学习 (Representation Learning) 层面解决问题。

1. 两阶段框架设计

第一阶段(图 2 右侧),使用 ST-GCN (Spatio-Temporal Graph Convolutional Network) 作为编码器,故意遮掉(Mask)一部分关节,让模型尝试重建。这迫使编码器学习人体结构的内在逻辑和运动趋势,而不是单纯记忆坐标。

第二阶段,将这个预训练好的编码器“冻结”并嵌入到轨迹预测模型中。此时,骨骼输入即使有缺失,编码器输出的“高阶特征”依然保持稳定。

自监督骨骼学习框架 Figure 2: 掩码自监督训练过程。

2. 多样化的掩码策略

为了模拟真实世界的复杂性,作者设计了三种掩码模式:

  • Temporal Consistent Mask:模拟长期遮挡(如行人走在柱子后)。
  • Random Mask:模拟随机检测失效。
  • Body-Part Mask:模拟局部肢体完全被挡住。

实验发现,50% 的随机采样掩码在各种测试场景下的泛化能力最强。

实验战绩:超越基线的稳准狠

在 JTA 大型合成数据集上的测试结果令人振奋:

  • 在“干净”环境下:我们的方法 ADE 为 0.898,甚至优于标准基线(0.920),打破了“拟合受损数据会降低清洁精度”的魔咒。
  • 在中等缺失下 (40% 缺失率):预测误差仅小幅增长,且依然显著优于其他所有变体模型。

模型总架构图 Figure 3: 整体架构:骨骼编码通过 Cross-Modality Transformer 与轨迹特征深度融合。

深度诊断:强依赖带来的高回报

通过“禁用骨骼模态”的消融实验(Ablation Study),作者揭露了一个有趣的现象:本文提出的方法比普通模型更依赖骨骼信息。

  • 普通模型在骨骼失效时 ADE 增加 0.643。
  • 本文方法在骨骼失效时 ADE 增加 1.491

这说明该方法真正挖掘出了骨骼中的“含金量”。正是因为模型学会了如何在高噪声下提取这些高价值信息,它才能在拐弯等复杂预测场景下表现得远超前人(见下图可视化)。

弯道预测对比 Figure 4: 弯道场景下,只有本文方法(Ours)成功利用骨骼姿态预测出了拐弯趋势。

结论与启示

这篇论文对于工业界(如机器人导航、智慧安防)有很强的落地参考意义。它告诉我们:面对下游场景中不可避免的传感器中断或噪声,最优雅的解法不是在末端去‘修补’,而是在感知的上游通过自监督学习建立起具有 Inductive Bias (归纳偏置) 的鲁棒表示。

虽然在缺失率超过 60% 的极端场景下,所有模型的精度都会不可避免地下降(毕竟这就是个病态问题),但在绝大多数现实遮挡情况下,这套框架已经展现出了极强的生命力。

发现相似论文

试试这些示例

  • 查找最近一年中结合人体骨骼姿态与社交交互特征进行轨迹预测的 Transformer 模型相关论文。
  • 哪篇论文最早在人体骨骼动作识别中提出了 SkeletonMAE 这一概念,本文在掩码策略和预测任务上做了哪些差异化改进?
  • 研究是否存在将基于扩散模型(Diffusion Models)的姿态补全技术替换掉本文的 MAE 结构以进一步提升轨迹预测鲁棒性的尝试?
目录
鲁棒性进阶:自监督骨骼表示学习如何挽救遮挡下的轨迹预测?
1. TL;DR
2. 核心痛点:精度与鲁棒性的“跷跷板”
3. 方法论:用自监督预训练筑起防御墙
3.1. 1. 两阶段框架设计
3.2. 2. 多样化的掩码策略
4. 实验战绩:超越基线的稳准狠
4.1. 深度诊断:强依赖带来的高回报
5. 结论与启示