[CVPR 2025] TeamHOI:打破人数限制,让类人智能体学会像搬运工一样完美协作
TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size
本文提出了 TeamHOI,一个能够让单一去中心化策略支持任意数量智能体(2-8人及以上)协同搬运物体的物理仿真框架。通过引入 Transformer 架构和 Teammate Tokens,该方法在 Isaac Gym 环境中实现了 SOTA 级别的多人-物体交互控制。
TL;DR
在传统的物理仿真(Physics-based)机器人控制中,训练一群类人机器人协同搬运重物一直是个难题——要么人数固定死,要么动作僵硬极不协调。来自 Garena、Sea AI Lab 和新加坡国立大学的研究者们推出了 TeamHOI 框架。它通过单一的去中心化策略(Decentralized Policy),让 2 个、4 个甚至 16 个机器人在没有任何全局指挥官的情况下,仅靠观察彼此就能自发形成稳定阵型,圆满完成重型物体的抬升与搬运任务。
背景定位:这是物理仿真多智能体交互(Multi-Agent HOI)领域的一次重要突破,首次实现了单一模型对任意团队规模及物体形状的通用适配。
痛点深挖:为什么“多人抬桌子”这么难?
在物理引擎里搞协作,面临的是“既要、又要、还要”的既定困局:
- 架构瓶颈:前人工作多用 MLP(多层感知机)做策略网络,输入维度是死板的。如果你训练的是 2 人协作,模型就处理不了 3 个人的状态。
- 数据荒漠:AMP(对抗运动先验)技术虽然能让模型学到真人动作,但市场上几乎没有“多人协同搬运物体”的高质量动捕数据。
- 感知缺失:之前的 SOTA 方法(如 CooHOI)假设智能体之间“装傻”,只感应物体的晃动来盲猜队友意图,这在重负载或复杂地形下极易导致翻车。
核心方法:Transformer + Masked AMP
1. 会观察队友的 Transformer
TeamHOI 抛弃了固定维度的 MLP,改用 Transformer 架构。每个智能体就像在刷“朋友圈”一样,将自己看到的队友位置、朝向等信息打成 Teammate Tokens。通过 Cross-Attention(交叉注意力机制),每个机器人能动态地感知周围队友的数量和意图,从而决定自己的脚步和力度。
图注:TeamHOI 架构。绿色智能体作为观察者,通过 Transformer 处理自身状态与灰色队友们的 Token,由于注意力机制对 Token 数量不敏感,实现了对任意人数的适配。
2. Masked AMP:从单人数据中“变”出协同动作
既然没有多人交互数据,作者提出了 Masked AMP。在训练判别器时,故意遮掉(Mask)与物体接触的手部和手臂动作,只让模型学习单人行走的优雅姿态;而手部该怎么抓、怎么抬,则完全交给特定的任务奖励(Task Rewards)去引导。这种“各管各”的策略巧妙地解决了数据不足的问题。
3. 主轴覆盖奖励(Principal-axes coverage reward)
为了让机器人不至于挤在一起,作者引入了一个基于物理直觉的奖励:主轴覆盖。系统会自动计算物体的重心和主惯性轴,引导机器人分布在能提供最大物理稳定性的位置上(如图 3 所示)。

实验与结果:力大砖飞的 8 人团队
研究团队在 Isaac Gym 仿真器中测试了方桌、圆桌和长方桌的搬运任务。
- 性能碾压:在 8 人协助模式下,TeamHOI 的成功率达到了恐怖的 97.5%,而基线方法 CooHOI* 仅有可怜的 42.2%。
- 极端载重:当桌子重量增加到 5 倍(约 300 公斤)时,少于 4 个机器人基本宣告放弃,但 8 个机器人组成的 TeamHOI 团队展现出了惊人的协作性,成功率依然维持在 81.1%。
图注:4人与8人协作对比。可以看到 TeamHOI 的路径(红线)非常平稳顺滑,而基线方法在多人场景下几乎陷入了混乱和冲突。
深度洞察:协作的本质是“留白”
TeamHOI 最令人启发的地方在于其 Masked AMP 的设计哲学。它意识到,如果我们强行让机器人模仿某种特定的多人交互动作,反而会限制它们在不同团队规模下的灵活性。
成功的关键点点:
- 低维感知,高维决策:每个智能体只需观察局部(队友位置),通过去中心化的方式达成全局共识。
- 物理规律作为 Inductive Bias:主轴覆盖奖励将复杂的力学稳定问题简化为了空间布局问题,极大加速了 RL 的收敛。
总结与局限
TeamHOI 成功打破了物理仿真中多智能体控制的人数屏障。尽管目前还是在仿真环境中运行,且忽略了复杂的手指接触细节(采用了球形手),但它为未来的工业机器人群控、多人协作游戏 AI 指明了方向。下一步,我们或许能看到这些虚拟人学会如何一起搬钢琴走楼梯,甚至进行更复杂的搭建任务。
