[2026] Rhythm:突破双足机器人物理交互难题,让“人形机”学会共舞
Rhythm: Learning Interactive Whole-Body Control for Dual Humanoids
本文提出了 Rhythm,这是首个能够在真实世界中部署的双足机器人(Dual Humanoids)全身交互控制统一框架。该框架集成了交互感知运动重定向(IAMR)与交互引导强化学习(IGRL),在 Unitree G1 机器人上成功实现了拥抱、手拉手跳舞等复杂物理耦合动作。
TL;DR
人形机器人的单体灵活性已接近极限,但如何让两个机器人像人一样自然地拥抱、握手或共舞?本文提出的 Rhythm 框架首次打通了从人类交互数据到机器人硬件部署的全链路。通过交互感知运动重定向(IAMR)和图引导强化学习(IGRL),研究者在 Unitree G1 硬件上实现了极高鲁棒性的双机全身交互控制。
背景定位:从孤岛到协作
目前的人形机器人研究主要聚焦于单机行走或操纵,即便涉及交互,也多是将对方视为“障碍物”或“被动载荷”。Rhythm 的出现改变了这一点,它将双机系统视为一个耦合的动力学整体,解决了形态学差异(Morphology Mismatch)带来的物理冲突问题。
痛点深挖:为什么“空气握手”难以避免?
直接将人类侧的交互数据映射到机器人会有两个致命伤:
- 运动学冲突:人与机器人的肢体比例不同,强制对齐手部位置可能导致机器人双脚离地;强制对齐单体动作,则会导致手部碰不到(空气握手)或过度穿入。
- 动力学耦合:在拥抱等强接触任务中,一个机器人的受力会直接影响另一个机器人的平衡,传统的独立控制策略会迅速发散导致摔倒。
核心方法论:IAMR 与 IGRL
1. 交互感知运动重定向 (IAMR)
作者提出了一种“解耦优化”策略。他们将交互 mesh 划分为自运动边 (Intra-Agent) 和 交互边 (Inter-Agent)。
- 双流流形构建:为每个机器人构建独立的缩放流形(Mind)以保证身体协调,同时构建统一流形(Muni)以保留交互距离的语义。
- 非线性弹簧系统:利用 Laplacian 坐标描述几何细节,并引入随距离衰减的动态权重。当两手接近时,权重激增以确保接触精度。
图 1:Rhythm 框架流程。从 IAMR 的轨迹生成,到 IGRL 的策略训练,最后通过状态估计完成实机部署。
2. 交互引导强化学习 (IGRL)
不仅是追踪轨迹,IGRL 引入了图奖励 (Graph-based Rewards):
- 交互图奖励:惩罚两机关键点间相对位移的偏差。
- 接触图奖励:精准定义了哪些部位应该接触,并对接触力进行正则化。
- 策略架构:采用 MAPPO 框架,利用 1D-CNN 处理历史观测数据,结合对同伴状态的感知(Peer Perception),使机器人具备预判对方动作的能力。
实验战绩:硬核刷榜与实机展示
在对比实验中,Rhythm 展现出统治级的性能。相较于传统的重定向方法,IAMR 在 Inter-X 数据集上的 F1 分数提升了 43%。
表 1:在 MAGIC 和 Inter-X 数据集上,Rhythm 在交互成功率(ISR)和接触成功率(CSR)上显著优于单机策略及消融模型。
在真机演示中(见图 2),即便研究者对正在交互的机器人进行剧烈的踢踹或推搡,机器人依然能通过闭环调整迅速找回交互位置,而不是机械地重复动作。这种**“抗干扰交互”**能力是其能够 Sim-to-Real 的核心保证。
图 2:从轻微接触的打招呼,到紧密耦合的拥抱,再到长周期的舞蹈,Rhythm 均能完美胜任。
总结与洞察
Rhythm 的成功标志着人形机器人进入了**“社会化协作”**的新阶段。其基于图的拓扑建模方法不仅适用于两台机器人,理论上可以扩展到多机系统。
局限性:目前系统仍依赖预构建的地图进行状态估计,且通讯延迟对极高频的动态交互(如格斗)仍有挑战。
未来启示:未来的“灵巧协作”将不再依赖于更精确的轨迹规划,而在于更加鲁棒的、对彼此状态感知的物理闭环策略。Rhythm 开放的 MAGIC 数据集也将成为多机研究的重要基石。
