[CVPR/ArXiv 2025] OmniXtreme:打破通用类人机器人极限运动控制的“精度-规模”魔咒

OmniXtreme: Breaking the Generality Barrier in High-Dynamic Humanoid Control

总结
问题
方法
结果
要点
摘要

本文提出了 OmniXtreme,一个旨在提升通用类人机器人高动态运动控制能力的框架。该方法结合了基于 Flow Matching 的生成式预训练与 Actuation-aware(执行器感知)的残差强化学习,成功在 Unitree G1 机器人上实现了包括后空翻、霹雳舞和武术在内的多种极限动作。

TL;DR

OmniXtreme 是由 BIGAI(北京通用人工智能研究院)与宇树科技(Unitree)联合提出的类人机器人控制框架。它通过 Flow Matching 生成式预训练 捕获海量运动先验,并通过 执行器感知(Actuation-aware)的残差学习 解决 Sim-to-Real 的物理鸿沟。该研究不仅能让同一套 Policy 操控机器人完成空翻、空手翻、霹雳舞等极难动作,更在理论上展示了类人机器人控制如何通过模型容量(Scaling)实现质变。


痛点深挖:为什么“全能型选手”这么难练?

在 humanoid 领域,我们一直面临一个精度-规模权衡(Fidelity-Scalability Trade-off)。当你试图让一个模型学会几百种动作时,普通的 MLP 策略通常会表现得非常“保守”:

  1. 梯度干扰 (Gradient Interference):在强化学习(RL)中,不同动作的奖励函数和物理特性可能冲突,导致模型在多任务训练时反复横跳,最后只能学到一个“平均值”动作。
  2. 物理执行瓶颈:仿真里的“大力出奇迹”在现实中会导致电机过流保护或电池瞬时掉压。大多数模型在 Sim 中表现完美,在 Real 中则是“见光死”。

运动库难度对比 图 1:OmniXtreme 处理的 XtremeMotion 库在角速度、角加速度和接触切换频率上远超传统基准(如 LAFAN1)。


核心机制:生成式预训练 + 物理残差微调

1. 基于 Flow Matching 的专家蒸馏

作者没有直接用 RL 硬啃多样化数据,而是采用了 Specialist-to-Unified 的思路:

  • 首先针对每个极限动作训练单独的专家(Specialist)策略。
  • 随后利用 Flow Matching (FM) 进行 DAgger 蒸馏。FM 相比传统的扩散模型(Diffusion),具有推理步数更少、收敛更快的优势。它学习的是一个向量场 ,将高斯噪声平滑地导航至专家动作分布。

2. 物理感知的残差微调 (Actuation-Aware Post-training)

由于 Flow Matching 策略是在理想仿真环境下预训练的,直接部署到 Unitree G1 必然会出问题。OmniXtreme 引入了一个轻量级的 MLP 残差策略

  • 执行器包络建模:将真实的“扭矩-速度”曲线(Torque-Speed Operating Envelope)嵌入仿真,让模型知道电机在高速运转时,能输出的扭矩是受限的。
  • 功率安全正则化:针对膝关节等重灾区,通过惩罚负功率(过度制动产生的回馈电流)来保护硬件,直接规避了硬件因瞬时高负荷导致的断电。

模型总架构图 图 2:两阶段流程:(a) 基于 DAgger 的生成式预训练;(b) 注入真实电机约束的残差后处理。


实验结果:人形机器人的“表演秀”

在实验中,OmniXtreme 展现出了极强的韧性:

  • 精度验证:在 XtremeMotion 任务中,成功率比传统的从头训练的 RL 高出近 16%。
  • 硬件部署:在复杂的 Unitree G1 机器人上,即便是对落地缓冲要求极高的“前手翻”(Handspring),模型也能通过残差修正保持平衡。

实验性能对比 表 2:OmniXtreme 在所有指标(MPJPE, Δvel, Success Rate)上全面超越基线方法。

关键洞察:容量确实有助于泛化

作者通过控制变量法发现,Flow Matching 策略的性能会随着模型规模(Transformer 深度/宽度)的增加而稳步提升,而传统的 MLP 策略在规模增大后提升迅速饱和。这说明 Generative Architecture 是机器人底层控制 Scaling Law 的关键。


总结与未来展望

OmniXtreme 的成功展示了具身智能的一种可行演进路径:把底层控制交给高容量的生成式模型,把物理约束交给残差网络。 这种做法不仅让机器人学会了“极限运动”,更重要的是它极大地拓宽了单一 Policy 的能力边界。

局限性:尽管引入了功率正则化,但在极高强度的冲击(如高处跳下落地)中,硬件限制(如电池电压瞬间波动)依然是无法仅靠算法填补的。未来的研究方向可能是将电池动力学与更深层的电感模型直接融入端到端训练中。


本文由资深学术主编重构。更多细节请参考原论文项目主页:https://extreme-humanoid.github.io/

发现相似论文

试试这些示例

  • 查找最近一年内利用 Flow Matching 或 Diffusion Policy 解决人形机器人全身动态控制(Whole-body Control)的相关论文。
  • 哪篇论文最早引入了 Actuator-constrained RL 模型?本文在电机摩擦和功率限制建模上与之有何改进?
  • 调研目前除了残差强化学习(Residual RL)之外,还有哪些方法能将预训练的生成式运动策略有效地部署到具有严苛物理约束的类人机器人硬件上?
目录
[CVPR/ArXiv 2025] OmniXtreme:打破通用类人机器人极限运动控制的“精度-规模”魔咒
1. TL;DR
2. 痛点深挖:为什么“全能型选手”这么难练?
3. 核心机制:生成式预训练 + 物理残差微调
3.1. 1. 基于 Flow Matching 的专家蒸馏
3.2. 2. 物理感知的残差微调 (Actuation-Aware Post-training)
4. 实验结果:人形机器人的“表演秀”
4.1. 关键洞察:容量确实有助于泛化
5. 总结与未来展望