[CVPR 2024] CLAIMS:通过闭环迭代运动合成,突破类人机器人控制的“难度天花板”

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

总结
问题
方法
结果
要点
摘要

本文提出了 CLAIMS,一个用于类人机器人物理控制的闭合回路自动化运动数据生成与迭代框架。 通过结合运动扩散模型(MDM)与多模态大模型(VLM/LLM)的反馈,CLAIMS 实现了运动数据难度与控制策略能力的协同演进,在仅使用 AMASS 数据集 1/10 规模的情况下,将平均跟踪失败率降低了 45%。

TL;DR

在物理仿真中实现类人机器人(Humanoid)的高动态控制一直被“数据饥渴”所困扰。传统的 MoCap 数据采集昂贵且大多是极其无聊的行走坐卧。本文提出的 CLAIMS 框架通过一种“左右互搏”的思路,利用生成式 AI(MDM + LLM)不断生产控制器“还没学会”的高难度动作(武术、空翻、高难度舞蹈),在极低成本下让控制器的鲁棒性提升了近一倍。

背景定位:静态数据的“温室效应”

目前的物理仿真控制算法(如 PHC, ASE)在 AMASS 等大型数据集上已经刷出了极高的分数。然而,一旦把这些模型丢到需要爆发力或复杂平衡的场景(比如踢拳或芭蕾),机器人往往会瞬间失控。

原因很简单:数据是死的,且难度太低。 实验室里的机器人就像在温室里长大的孩子,从未见过复杂的动态特征(High-Dynamic Features)。

核心直觉:如何让 AI 自己给自己“出难题”?

作者的 Insight 在于,我们不再需要昂贵的真人采集,而是建立一个 “教练-运动员” 的演进系统:

  • 运动员(Controller):通过 RL 学习跟踪运动。
  • 教练(LLM + Diffusion):负责观察运动员的表现。如果运动员已经学会了“踢腿”,教练就通过修改 Prompt 让 Diffusion 生成“旋转 360 度踢腿”。

1. 专业运动的语义编排

为了不让生成出来的动作变成乱码,研究者定义了一个四维空间:

  • Base Action(原子动作):跳跃、翻滚。
  • Combo Action(连招逻辑):翻滚后立即接跳跃。
  • Detail(技术细节):手臂的开合度、落地的稳定性。
  • Speed & Rhythm(节奏):爆发力的时机。

模型架构图 图 1:CLAIMS 的闭环管线:从 5 大专业领域库中提取变量,通过 MDM 合成,再由 VLM 评分反馈。

2. 多模态“裁判”:VLM 与 物理指标的融合

CLAIMS 最精妙的地方在于其反馈机制。它不仅看物理上的 MPJPE(关节位置误差),还引入了视觉大模型(GPT-4o/Qwen-VL)作为“主观评委”。

  • 物理指标告诉系统:机器人有没有摔倒?
  • VLM 评价告诉系统:这个动作看起来够不够专业?难度系数是否符合预期?

通过 Gemini-CoT(思维链) 将这两者结合,LLM 会分析:“由于机器人在连续旋转中平衡得分较低,下一轮我们需要加强对‘向心力控制’的针对性 Prompt 生成。”

实验战绩:以 1/10 的数据实现 45% 的提升

在最关键的实验对比中,CLAIMS 展现了惊人的效率:

  • 泛化性极强:在完全未见的 Kungfu(武术)和 AIST++(舞蹈)测试集上,CLAIMS 训练出的模型(L6 轮次)成功率远超在海量静态数据上训练的基准模型。
  • 动作分布漂移:t-SNE 可视化显示,CLAIMS 生成的数据成功“飞出”了原始训练集的平庸分布,探索到了高动态的边界。

实验结果对比 图 2:能力演进可视化。L0 模型(初级数据)在遇到“空中快踢”时直接崩溃,而 L6 模型(迭代后)则能完美保持平衡。

深度洞察:数据合成的“反直觉”力量

通常我们认为生成出的数据是“脏”的,不如真实 MoCap 可靠。但 CLAIMS 的结果表明:在物理控制领域,分布的“挑战性”比数据的“绝对精度”更重要。 尽管 MDM 生成的动作偶尔会有物理瑕疵(所以才需要 VLM 过滤),但它提供的极限动力学特征(如极高的瞬时加速度)却是传统平庸数据集中完全缺失的。这种“对抗性”的课程生成,才是提升机器人泛化能力的真谛。

总结与局限

CLAIMS 为具身智能提供了一个低成本 Scaling 的蓝图。不过,目前该方法依然依赖一个预定义的方案模板库。未来的终极形态应该是完全摒弃人工辅助的模板,让 LLM 基于对物理法则的深度理解,自主设计出人类甚至从未做出过的极限动作来打磨机器人的控制极限。


关键词:类人机器人控制、课程学习、运动合成、闭环迭代、多模态大模型

发现相似论文

试试这些示例

  • 查找最近利用生成式模型(如 Diffusion 或 LLM)自动合成机器人仿真训练数据并实现闭环迭代的相关论文。
  • 探究 Motion Diffusion Model (MDM) 的原始理论框架,并分析其在处理超分布或极端动力学动作时的局限性来源。
  • 调研是否有研究将此类“难度感知”的动态数据集生成方法应用到四足机器人或复杂机械臂的操作任务中?
目录
[CVPR 2024] CLAIMS:通过闭环迭代运动合成,突破类人机器人控制的“难度天花板”
1. TL;DR
2. 背景定位:静态数据的“温室效应”
3. 核心直觉:如何让 AI 自己给自己“出难题”?
3.1. 1. 专业运动的语义编排
3.2. 2. 多模态“裁判”:VLM 与 物理指标的融合
4. 实验战绩:以 1/10 的数据实现 45% 的提升
5. 深度洞察:数据合成的“反直觉”力量
6. 总结与局限