[CVPR/CoRL 2025] LE SSMIM IC:基于统一距离场表示的人形机器人长程交互突破

LessMimic: Long-Horizon Humanoid Interaction with Unified Distance Field Representations

总结
问题
方法
结果
要点

本文提出了 LE SSMIM IC,这是一个统一的人形机器人长程交互框架。该方法引入了基于距离场(Distance Field, DF)的几何表示,使单一全行波策略能够在无需运动参考的情况下,实现跨物体形状与尺度的泛化,并支持多达 40 个连续异构任务的技能组合。

TL;DR

传统的机器人交互往往依赖于“照葫芦画瓢”的参考运动(Reference Motion),一旦物体变大或形状稍改,机器人就会“不知所措”。本文提出的 LE SSMIM IC 彻底抛弃了运动参考,通过引入**距离场(Distance Field, DF)**作为核心感知表征,让人形机器人学会了基于几何关系的“物理直觉”。实验证明,单一策略不仅能搬动不同形状的箱子,还能流畅衔接推、举、搬、坐等 40 个连续动作。

背景定位:从“动作追踪”到“几何推理”

在人形机器人领域,实现自然且鲁棒的交互一直是个难题。

  • 基于参考的方法(Reference-based):过于依赖 MoCap 数据,物体一变动作就作废。
  • 无参考方法(Reference-free):虽然灵活,但往往针对单一任务通过 Reward Engineering 强行训练,缺乏通用性。

LE SSMIM IC 的核心洞察在于:交互的本质是机器人末端与物体表面的局部几何关系。 无论杯子多大,抓取瞬间手掌与表面的距离和法向量分量是相似的。

核心方法:距离场(Distance Field)驱动的交互

1. 统一的几何表示

作者抛弃了点云或体素(Voxel)等离散且计算昂贵的表示,转而使用 距离场 (DF)。DF 为空间中每一点分配到最近表面的距离 及其梯度

更精妙的是,作者将机器人各部位的速度 分解为:

  • 法向速度 ():代表接近物体的强度或施加压力。
  • 切向速度 ():代表沿表面的滑动或移动。

这种分解捕捉到了交互的动态本质,且对物体的全局位姿和尺度具有不变性(Invariance)。

模型架构图 图 1:LE SSMIM IC 训练流水线:从 DF 提取特征,经过 VAE 编码,再到基于 AIP 的 RL 微调。

2. 对抗交互先验 (AIP)

为了让机器人在随机生成的几何体上表现稳定,作者提出了 AIP (Adversarial Interaction Priors)。这类似于给机器人一个“审美鉴赏器”:判别器学习什么是“正确的交互几何特征”(例如手部保持在物体表面的特定距离分布),并以此引导强化学习,从而摆脱了对特定运动轨迹的依赖。

实验战绩:极致的泛化与长程执行

1. 尺度与形状泛化

在测试中,即使物体尺度从原始大小缩小到 0.4 倍或放大到 1.6 倍,LE SSMIM IC 依然能保持极高的成功率。相比之下,传统的 ResMimic 等方法在尺度偏离 1.0 时性能会迅速跌落至零。

实验结果对比 表 1:LE SSMIM IC 在不同任务和尺度下的成功率,显著优于基线方法。

2. 惊人的长程技能组合

最令人印象深刻的是其长程组合能力。在没有环境重置的情况下,单一策略可以指挥机器人执行“推柜子 -> 走位 -> 捡箱子 -> 搬运 -> 坐下休息”的复杂序列。这种能力并非来自显式的状态机切换,而是源于统一 DF 隐空间下的自然转换。

交互演示 图 2:真实世界部署中,机器人连续执行推、捡、搬运任务,展现了隐式的技能切换。

深度洞察:为什么这很重要?

LE SSMIM IC 提供了一个关键启示:对于人形机器人这种高冗余系统,显式的轨迹规划不如局部的几何场约束。 通过 DAgger 蒸馏后,该系统可以摆脱 MoCap 系统,仅凭胸前的深度相机即可完成任务,这为机器人走进非结构化的家庭环境打下了基础。

局限性探讨:目前 DF 的构建仍依赖于物体模型的已知性(在蒸馏阶段虽然用了深度图,但教师仍需特权信息)。未来如果能结合实时生成的神经辐射场(NeRF)或高斯泼溅(GS)来动态获取 DF,其潜力将进一步释放。

总结

LE SSMIM IC 成功地将“距离场”这一经典几何概念引入现代人形机器人控制流水线,通过对抗学习机制实现了跨形状、跨维度的鲁棒交互。它证明了:只要表征选得对,人形机器人也能拥有超越人类预设脚本的灵活适应力。

发现相似论文

试试这些示例

  • 查找最近一年利用距离场(Distance Field)或有符号距离函数(SDF)进行机器人全波控制(Whole-body Control)的 SOTA 论文。
  • 哪篇工作最早提出了对抗运动先验(AMP),本文提出的 AIP(Adversarial Interaction Priors)在其基础上做了哪些针对交互任务的改进?
  • 调研将 DAgger 算法应用于具身智能领域从特权信息(如 MoCap)到感知输入(如 Depth/RGB)进行跨模态策略蒸馏的其他代表性研究。
目录
[CVPR/CoRL 2025] LE SSMIM IC:基于统一距离场表示的人形机器人长程交互突破
1. TL;DR
2. 背景定位:从“动作追踪”到“几何推理”
3. 核心方法:距离场(Distance Field)驱动的交互
3.1. 1. 统一的几何表示
3.2. 2. 对抗交互先验 (AIP)
4. 实验战绩:极致的泛化与长程执行
4.1. 1. 尺度与形状泛化
4.2. 2. 惊人的长程技能组合
5. 深度洞察:为什么这很重要?
6. 总结