[CVPR 2026] ULTRA:突破参考限制,实现类人机器人感知驱动的全身自主交互
ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation
本文提出了 ULTRA,一个专为人形机器人设计的统一多模态全身控制框架。该框架实现了从密集动作跟踪到稀疏任务目标的无缝切换,在 Unitree G1 机器人上成功达成了基于第一视角感知的自主全身移动操作(Loco-manipulation),并刷新了复杂交互任务的 SOTA 表现。
TL;DR
人形机器人的“全能化”障碍在于:高性能往往依赖于“死记硬背”人类动作参考,一旦脱离参考或面临传感器噪声就容易崩盘。ULTRA (Unified Multimodal Control) 通过构建一个统一的多模态控制器,让机器人既能像运动员一样精准模仿动作,又能像人类一样仅凭一个“搬箱子”的意图和第一视角视觉,自主协调全身完成任务。
背景:人形机器人的“精准”与“灵活”之争
在人形机器人领域,长期存在着两种技术路线的割裂:
- Tracking-based:机器人像“复读机”一样跟踪一段预设的人类动作。虽然动作优美,但只要环境中物体位置稍有偏差,动作就会失效。
- Goal-conditioned:机器人只听指令(如“走到那儿”)。虽然灵活,但在处理涉及重物搬运、身体平衡的复杂交互(Loco-manipulation)时,往往动作僵硬且容易摔倒。
ULTRA 的核心使命就是将两者统一,构建一个能根据感知信息、任务指令和参考动作动态调整行为模式的“全能大脑”。
核心方法论:从数据生成到策略统一
1. 物理驱动的神经重定向 (Neural Retargeting)
作者认为,很多控制策略效果不好是因为训练数据(人类 MoCap)直接投影到机器人身上时,物理上是“不可行的”(如:机器人的重磁中心与人不同)。ULTRA 并没有采用简单的运动学映射,而是将重定向变成了一个受模拟器约束的强化学习优化问题。
上图展示了 Stage 1 和 Stage 2 的流程:从人类数据到物理一致的机器人演示数据。
2. 多模态学生策略蒸馏
为了让机器人能在部署时动态应对信息缺失(比如丢了 MoCap 信号、只有视觉),ULTRA 设计了一个带有 Availability Masking 的 Transformer 架构。
- 训练时,随机掩盖掉“参考轨迹”、“物体状态”等输入。
- 模型必须学会:有轨迹参考时,精准跟踪;没参考只有目标时,从潜在空间(Latent Space)提取之前学过的运动技能来“填补”动作。
3. RL Finetuning:从模仿到超越
单纯的模仿学习(Imitation Learning)只能让机器人学会数据里的东西。作者引入了 RL 微调,在模拟器中随机扰动物体和机器人的状态,强迫机器人学会如何从推搡、打滑等 Out-of-Distribution (OOD) 场景中恢复。
实验战绩:极致的稳健性
在与 OmniRetarget 和 HDMI 等强基线的对比中,ULTRA 在 OOD 情况下的成功率几乎翻倍。更惊人的是其物理保真度:
实验数据显示,ULTRA 的穿模深度(Penetration)和脚部滑动(Foot Skating)远低于现有方法,这对于真机部署至关重要。
此外,通过 t-SNE 可视化可以发现,ULTRA 的潜在空间能够清晰地对不同控制模式和动作语义进行聚类。这意味着机器人确实“理解”了不同任务背后的运动范式。
深度洞察:为什么 ULTRA 能成功?
- 物理一致性是基石:如果训练数据本身不符合物理规律(如悬空抓取),由于 RL 具有极强的“走捷径”倾向,最终学到的策略在真机上必然失效。
- 掩码机制(Masking)的魔力:通过在训练中人为制造“信息缺损”,强迫策略学习跨模态的等效映射(如:将深度图特征映射到物体 6D 位姿空间),从而实现了从全方位感知到残缺感知的平滑退化。
- 蒸馏作为正则化:实验中一个有趣的发现是,学生策略的抖动(Jitter)甚至比特权教师还低。这说明蒸馏过程滤除了教师策略中一些过度反应的噪声,让控制更加平滑。
总结与展望
ULTRA 提供了一个可扩展的方案,让机器人能像人类一样,在有明确动作指导时“亦步亦趋”,在只有朦胧意图时“自主决策”。
局限性:目前的系统在面对极度遮挡(Occlusion)和极端摩擦力变化时仍有失效可能。未来的研究方向将集中在集成触觉(Tactile Sensing)和更强大的视觉语言模型(VLM)以处理更复杂的语义指令。
在真机 Unitree G1 上,ULTRA 展现出了从纯视觉输入完成长程复杂搬运任务的能力。
