[CMU 2026] 3PoinTr:跨越体态鸿沟,从人类“随手拍”视频中预训练机器人操纵技能

3PoinTr: 3D Point Tracks for Robot Manipulation Pretraining from Casual Videos

总结
问题
方法
结果
要点
摘要

本文提出了 3PoinTr,一种基于 3D 点轨迹(3D Point Tracks)的机器人操纵预训练框架。该方法通过 transformer 架构从非受限的人类视频中预测未来的 3D 场景演化,并在极少量(20 次)机器人演示下实现了 SOTA 的行为克隆效果。

TL;DR

机器人学习的“圣杯”之一是让机器能直接从人类海量的日常视频中习得技能。然而,人类和机器人的胳膊长得不一样、动起来也不一样(体态鸿沟)。CMU 团队提出的 3PoinTr 给出了一种新解法:不学动作,学“场景如何演化”。它通过预测 3D 点轨迹 (3D Point Tracks) 作为通用语言,在仅需 20 次机器人演示的情况下,就能在复杂操纵任务中大幅超越现有的行为克隆方法。

背景定位:为何点轨迹是最佳“中介”?

在机器人操作领域,纯 2D 表征(如图像)缺乏精准的深度信息,且容易受光影干扰。而传统的 3D 表征(如点云)虽有几何信息,却缺乏时间维度的预测能力。

3PoinTr 认为,点轨迹具有以下四大核心优势:

  1. 物理一致性:直接在度量空间建模,与机器人动作空间天然对齐。
  2. 体态无关性 (Embodiment-agnostic):无论是人用手抓,还是机器人用夹爪,物体的移动轨迹(如杯子被扶正的过程)是相似的。
  3. 视觉鲁棒性:点轨迹比光流更能抵抗遮挡和视角变化。

痛点分析:现有的预训练错在哪?

先前的 Video Pretraining 方法(如 ATM 或 AMPLIFY)往往会包含机器人或人类的手部轨迹。这带来两个问题:

  • 体态偏见:人类的抓取方式对机器人可能是不适用的(会导致奇异位姿)。
  • 分布偏移:当模型习惯了视频里有“人手”时,在测试阶段看到“金属夹爪”会产生严重的性能下降。

3PoinTr 的 Insight 非常直接:在预训练阶段,把所有人手和机器人点全部去掉 (Remove Embodiment Points)。模型只盯着物体看,学习物体在任务中应该怎么动。

核心方法论 (Methodology)

1. 3D 点轨迹预测架构

3PoinTr 放弃了复杂的 VAE 结构,采用了一个轻量化但表达力极强的 Transformer Decoder。它输入一帧 3D 点云,直接输出 N 个点在未来 T 个时间步的坐标。

模型架构图

图 1:3PoinTr 架构。左侧负责预测点轨迹,右侧通过 Perceiver IO 提取特征并指导 Diffusion Policy 生成动作。

2. 特征压缩与策略生成

由于 N 个点的轨迹维度极大(),直接作为策略输入会导致过拟合。作者引入了 Perceiver IO 架构,利用一组可学习的 Query Token 去“扫描”点轨迹,从中提取出最关键的物理特征(如把手的位置、物体的翻转趋势)。最后,这些特征被送入 Diffusion Policy,以开路(Open-loop)的方式生成连续动作。

实验战绩 (Results)

轨迹预测的精度

在与现有 SOTA 方法 General Flow 的对比中,3PoinTr 在“关键点位移误差 (5% ADE)”上实现了显著领先。特别是在处理部分遮挡(如纸团丢入纸桶)时,3PoinTr 能够补全消失点的轨迹,这是前人工作较难处理的。

实验结果对比

小样本下的爆发力

在真实世界任务(如折袜子、扔纸团)中,3PoinTr 仅凭 20 个示范 就达到了 90% 以上的成功率,而直接进行 3D 行为克隆(DP3)在某些任务上只有 10%-20% 的表现。

真实世界任务演示

深度洞察:为什么 3PoinTr 有效?

  1. 解耦了“做什么”和“怎么做”:点轨迹回答了“物体应该怎么变” (What to do),而策略层只需要学习“机器人手臂怎么配合这一变化” (How to do)。
  2. 开路预测的优势:与闭路控制容易受实时遮挡干扰不同,3PoinTr 是一次性预测全时段轨迹,这种 Global Vision 使得它在物体被夹爪完全遮挡时,依然知道目标在哪。
  3. Casual Videos 的兼容性:它不需要人类在视频中模仿机器人的死板动作,人类可以用最自然的方式操作,模型会自动提取本质的物体动力学。

总结与局限

3PoinTr 证明了 3D 物理语义是跨体态迁移的核心。

  • 局限性:目前采用开路控制,意味着如果过程中发生意外碰撞,机器人无法根据实时反馈进行调整。
  • 未来展望:将其与更大规模的互联网视频、多模态大模型(VLM)结合,或许能让机器人不仅学会“搬运”,还能学会更加精细的工具使用技能。

Takeaway:如果你想要机器人学得快且稳,不要让它模仿人的手,要让它读懂物体在 3D 空间里的“意图轨迹”。

发现相似论文

试试这些示例

  • 查找最近其他使用 3D 点轨迹(3D Point Tracking)或场景流(Scene Flow)进行机器人操纵学习的 SOTA 论文。
  • 哪篇论文最早在机器人学习中引入了 Perceiver IO 架构来处理点云或轨迹数据,本文的压缩策略有何改进?
  • 有哪些研究探讨了将基于 3D 点轨迹的预训练方法扩展到多任务、跨环境的长程(Long-horizon)机器人操纵任务中?
目录
[CMU 2026] 3PoinTr:跨越体态鸿沟,从人类“随手拍”视频中预训练机器人操纵技能
1. TL;DR
2. 背景定位:为何点轨迹是最佳“中介”?
3. 痛点分析:现有的预训练错在哪?
4. 核心方法论 (Methodology)
4.1. 1. 3D 点轨迹预测架构
4.2. 2. 特征压缩与策略生成
5. 实验战绩 (Results)
5.1. 轨迹预测的精度
5.2. 小样本下的爆发力
6. 深度洞察:为什么 3PoinTr 有效?
7. 总结与局限