[RSS 2025] HoMMI:无需机器人也能教全身协作?跨具身移动操作的新范式

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

总结
问题
方法
结果
要点
摘要

本文提出了 HoMMI,一个旨在从无机器人的纯人类演示中学习全身移动操作(Whole-Body Mobile Manipulation)的框架。通过结合头戴式设备和分布式相机,HoMMI 实现了在复杂环境下的大规模数据采集,并在双臂移动机器人上达成了长程任务的 SOTA 表现。

TL;DR

斯坦福大学与丰田研究院(TRI)联合推出的 HoMMI 框架,通过一套极其简便的 iPhone 穿戴设备,让普通人就能在真实场景中“手拉手”教会机器人复杂的全身移动操作任务。它巧妙地利用 3D 视觉抽象和“视点(Look-at Point)”动作表示,填补了人类与机器人之间的形态鸿沟。

背景定位:这是移动操作(Mobile Manipulation)领域从遥操作转向大规模、低成本人类演示采集的关键进展,特别是在长程、双臂协作任务上刷新了性能上限。

HoMMI 系统总览

痛点深挖:消失的全局观与具身差异

在训练移动机器人时,我们通常面临两难:

  1. 看得太窄:传统的 UMI 依赖 Wrist Camera,虽然操作精准,但就像蒙着眼走路,一旦目标脱离视野,机器人就无法进行导航和重定位。
  2. 长得不像:人类示范者和机器人(如 Rainbow Robotics RB-Y1)在身高、颈部自由度(Human 6-DoF vs Robot 2-DoF)以及手臂外观上完全不同。直接模仿人类的头部转动往往会导致机器人“扭断脖子”或出现严重的幻觉误差。

Methodology:化解矛盾的三个关键

1. 具身无关(Embodiment-Agnostic)的 3D 视觉

为了让机器人不被人类演示者的手臂干扰,HoMMI 将头戴相机的 RGB-D 图像投影到 3D 空间。通过在夹持器坐标系下设置掩模,主动过滤掉人类的手臂点云。随后使用 DINO-v3 提取特征并配合 3D 位置编码,将视觉信息转化为一种“只看物体、不看人”的高维表征。

2. 从“临摹”到“注视”:3D Look-at Point

不再强求机器人精确模仿人类 6-DoF 的头部姿态,而是提取人类视线与场景的交点(Look-at Point)。这样方案不仅适配了机器人仅有的 2-DoF 颈部,还保留了人类在执行任务时的**主动感知(Active Perception)**意图——即“为了抓这个,我得先盯住它”。

动作表示设计

3. 约束感知的全身控制器(WBC)

HoMMI 采用基于 Mink 的微分逆运动学(IK)求解器,解决以下四个目标:

  • 精度:高权重跟踪双臂末端轨迹。
  • 平滑:通过时间插值(Slerp)消除控制频率不一致带来的抖动。
  • 稳定:强制执行质心(CoM)支撑约束,防止机器人在移动中倾倒。
  • 拟人:通过正则化项引导机器人保持类似人类的默认姿态。

实验与结果:全方位碾压 Baseline

团队在三个极具挑战性的任务中进行了测试:

  • Laundry(洗衣):搜索桌子 -> 双臂抓取 -> 寻找远处的筐 -> 导航并投放。
  • Delivery(投递):长程(6x6m)导航并精准放置箱子。
  • Tablescape(铺桌布):极具挑战的双臂协同对齐任务。

任务演示

关键战绩: 在 Delivery 任务中,HoMMI 实现了 85% 的成功率,而缺乏全局视野的原始 UMI (Wrist-Only) 只有 15%。消融实验显示,如果禁用主动颈部控制(Active Neck),成功率会下降约 20-30%,这证明了“边看边走”策略的重要性。

注意力机制对比 可视化显示:HoMMI 的注意力机制(最左侧)能精准聚焦在任务相关的物体上,而非杂乱的背景或具身部件。

深度洞察与总结

HoMMI 的核心贡献在于它不仅提供了硬件上的 Scale-up 方案,更在算法上提出了“视觉/动作抽象层”。它告诉我们:机器人不需要完全变成人,只需要理解人类在做什么。

局限性: 目前系统仍依赖短时观察窗口。在面对超长程或带有遮挡的任务时,引入类似 Transformer-based 的长期记忆机制将是必然趋势。此外,由于系统是纯视觉的,在需要精细力控的接触密集型任务(Contact-rich tasks)中,仍有提升空间。

未来展望: 随着这套低成本采集设备的普及,我们可能会看到机器人界的“数据集大爆发”。这不仅是技术的胜利,更是数据民主化的胜利。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决移动操作中人类与机器人具体具身差异(Embodiment Gap)的策略迁移论文。
  • 哪篇论文最早提出了 UMI (Universal Manipulation Interface) 框架,本文在其手部相机基础上做了哪些坐标系变换的改进?
  • 有哪些研究探讨了将 Diffusion Policy 与全身动力学约束(如 Mink 或二次规划优化)结合应用于人型机器人的任务?
目录
[RSS 2025] HoMMI:无需机器人也能教全身协作?跨具身移动操作的新范式
1. TL;DR
2. 痛点深挖:消失的全局观与具身差异
3. Methodology:化解矛盾的三个关键
3.1. 1. 具身无关(Embodiment-Agnostic)的 3D 视觉
3.2. 2. 从“临摹”到“注视”:3D Look-at Point
3.3. 3. 约束感知的全身控制器(WBC)
4. 实验与结果:全方位碾压 Baseline
5. 深度洞察与总结