[CMU 2026] 3PoinTr:跨越体态鸿沟,从人类“随手拍”视频中预训练机器人操纵技能
3PoinTr: 3D Point Tracks for Robot Manipulation Pretraining from Casual Videos
本文提出了 3PoinTr,一种基于 3D 点轨迹(3D Point Tracks)的机器人操纵预训练框架。该方法通过 transformer 架构从非受限的人类视频中预测未来的 3D 场景演化,并在极少量(20 次)机器人演示下实现了 SOTA 的行为克隆效果。
TL;DR
机器人学习的“圣杯”之一是让机器能直接从人类海量的日常视频中习得技能。然而,人类和机器人的胳膊长得不一样、动起来也不一样(体态鸿沟)。CMU 团队提出的 3PoinTr 给出了一种新解法:不学动作,学“场景如何演化”。它通过预测 3D 点轨迹 (3D Point Tracks) 作为通用语言,在仅需 20 次机器人演示的情况下,就能在复杂操纵任务中大幅超越现有的行为克隆方法。
背景定位:为何点轨迹是最佳“中介”?
在机器人操作领域,纯 2D 表征(如图像)缺乏精准的深度信息,且容易受光影干扰。而传统的 3D 表征(如点云)虽有几何信息,却缺乏时间维度的预测能力。
3PoinTr 认为,点轨迹具有以下四大核心优势:
- 物理一致性:直接在度量空间建模,与机器人动作空间天然对齐。
- 体态无关性 (Embodiment-agnostic):无论是人用手抓,还是机器人用夹爪,物体的移动轨迹(如杯子被扶正的过程)是相似的。
- 视觉鲁棒性:点轨迹比光流更能抵抗遮挡和视角变化。
痛点分析:现有的预训练错在哪?
先前的 Video Pretraining 方法(如 ATM 或 AMPLIFY)往往会包含机器人或人类的手部轨迹。这带来两个问题:
- 体态偏见:人类的抓取方式对机器人可能是不适用的(会导致奇异位姿)。
- 分布偏移:当模型习惯了视频里有“人手”时,在测试阶段看到“金属夹爪”会产生严重的性能下降。
3PoinTr 的 Insight 非常直接:在预训练阶段,把所有人手和机器人点全部去掉 (Remove Embodiment Points)。模型只盯着物体看,学习物体在任务中应该怎么动。
核心方法论 (Methodology)
1. 3D 点轨迹预测架构
3PoinTr 放弃了复杂的 VAE 结构,采用了一个轻量化但表达力极强的 Transformer Decoder。它输入一帧 3D 点云,直接输出 N 个点在未来 T 个时间步的坐标。

图 1:3PoinTr 架构。左侧负责预测点轨迹,右侧通过 Perceiver IO 提取特征并指导 Diffusion Policy 生成动作。
2. 特征压缩与策略生成
由于 N 个点的轨迹维度极大(),直接作为策略输入会导致过拟合。作者引入了 Perceiver IO 架构,利用一组可学习的 Query Token 去“扫描”点轨迹,从中提取出最关键的物理特征(如把手的位置、物体的翻转趋势)。最后,这些特征被送入 Diffusion Policy,以开路(Open-loop)的方式生成连续动作。
实验战绩 (Results)
轨迹预测的精度
在与现有 SOTA 方法 General Flow 的对比中,3PoinTr 在“关键点位移误差 (5% ADE)”上实现了显著领先。特别是在处理部分遮挡(如纸团丢入纸桶)时,3PoinTr 能够补全消失点的轨迹,这是前人工作较难处理的。

小样本下的爆发力
在真实世界任务(如折袜子、扔纸团)中,3PoinTr 仅凭 20 个示范 就达到了 90% 以上的成功率,而直接进行 3D 行为克隆(DP3)在某些任务上只有 10%-20% 的表现。

深度洞察:为什么 3PoinTr 有效?
- 解耦了“做什么”和“怎么做”:点轨迹回答了“物体应该怎么变” (What to do),而策略层只需要学习“机器人手臂怎么配合这一变化” (How to do)。
- 开路预测的优势:与闭路控制容易受实时遮挡干扰不同,3PoinTr 是一次性预测全时段轨迹,这种 Global Vision 使得它在物体被夹爪完全遮挡时,依然知道目标在哪。
- Casual Videos 的兼容性:它不需要人类在视频中模仿机器人的死板动作,人类可以用最自然的方式操作,模型会自动提取本质的物体动力学。
总结与局限
3PoinTr 证明了 3D 物理语义是跨体态迁移的核心。
- 局限性:目前采用开路控制,意味着如果过程中发生意外碰撞,机器人无法根据实时反馈进行调整。
- 未来展望:将其与更大规模的互联网视频、多模态大模型(VLM)结合,或许能让机器人不仅学会“搬运”,还能学会更加精细的工具使用技能。
Takeaway:如果你想要机器人学得快且稳,不要让它模仿人的手,要让它读懂物体在 3D 空间里的“意图轨迹”。
