VOFA:让双足机器人像人一样推重物,力自适应与视觉闭环的完美融合

VOFA: Visual Object Goal Pushing with Force-Adaptive Control for Humanoids

总结
问题
方法
结果
要点
摘要

本文提出了 VOFA,一个面向人形机器人的视觉导向目标推物系统。该系统结合了高层全景深度视觉策略与底层力自适应全身控制器(WBC),在无需预知物体物理参数的情况下,实现了复杂环境下的闭环目标导向推物任务。

TL;DR

在仓库搬运等场景中,让高度不稳的人形机器人推行重物是一项极具挑战的任务。德克萨斯大学奥斯汀分校的研究团队提出 VOFA,通过两层分层架构,使人形机器人能够依靠自带的深度视觉,将未知质量(最高达自身体重 50% 以上)的物体精准推向任意目标位置,并具备极强的抗扰动和在线规划能力。

痛点深挖:为什么“推重物”对人形机器人这么难?

现有的机器人操控研究大多集中在抓取(Prehensile Manipulation),而对于推行(Pushing)这类非抓取任务,存在几个核心挑战:

  1. 动力学不确定性:物体的质量中心(CoM)、地面摩擦力通常不可知。
  2. 感知局限:单纯依靠车载摄像头(Egocentric Perception)会有视野丢失和深度噪声问题。
  3. 策略短视:如果简单的给机器人一个“靠近物体”的奖励,它会迫不及待地贴上去,结果反而挡住了推向目标的路径。

核心方法论:分层治理,力觉与视觉双修

VOFA 系统由两个核心层级组成,通过解耦复杂度来提升鲁棒性。

1. 底层:力自适应全身控制 (Force-Adaptive WBC)

底层控制器基于 FALCON 框架。它的直觉是:不需要提前知道物体多重,而是通过在训练中加入大量的端执行器(End-effector)扰动,让机器人学会一种“以不变应万变”的姿态控制。当推行重物产生巨大的反作用力时,WBC 会通过全身协同来维持平衡,避免“踢”物体或滑倒。

模型架构图 图 2:VOFA 的分层设计:高层视觉策略输出运动命令,底层力自适应控制器执行关节动作。

2. 高层:基于蒸馏的视觉策略

研究者采用了 Teacher-Student 训练范式:

  • 教师策略:拥有“上帝视角”,能接触到物体质量、精确速度等特权信息。
  • 学生策略:仅使用车载摄像头深度图和自身本体感知。通过 DAgger 算法,学生不断模仿教师在高难度配置下的决策。
  • 对准奖励 (Alignment Reward):这是 VOFA 成功的关键秘诀。它引入了一个奖励项,迫使机器人在接触物体前,先绕行到物体相对于目标点的“正后方”,实现了从“盲目推”到“有目的推”的转变。

实验战绩:突破载荷极限

VOFA 在 Booster T1 人形机器人上进行了部署。最令人赞叹的实验是,机器人在没有训练过超大质量的情况下,成功推行了 17kg 的纸箱。考虑到机器人自重仅约 30kg 左右,这相当于一个成年人推着一辆轿车前进。

实验结果对比 表 1 & 2:实验数据显示,带有力自适应 (w/ FA) 的 VOFA 在各项任务(侧向、后方目标)中的成功率远超基准模型。

此外,VOFA 展示了极强的闭环修正能力

  • 抗干扰:在推行过程中,实验人员推开纸箱,机器人能立刻停下寻找物体,重新对准并继续任务。
  • 质心偏置:即使物体一侧被加重,导致推行轨迹偏移,机器人也能通过视觉反馈自行调整接触点。

深度洞察与总结

VOFA 的成功揭示了人形机器人操控的一个重要趋势:不要试图在神经网络里解决所有物理建模问题。 通过底层控制器(WBC)处理物理层面的力学鲁棒性,让高层神经网络专注于语义层面的“位置对准”和“视觉导航”,这种解耦极大地降低了 Sim-to-Real 的迁移难度。

局限性:目前 VOFA 还需要外部提供目标位置的相对坐标,未来如果能结合视觉语言模型(VLM)直接从“把箱子推到饮水机旁”这种自然语言指令中提取目标,将更具实用价值。


Takeaway: VOFA 是一次典型的“分治思想”在机器人学中的胜利,它为人形机器人在非结构化负载任务中提供了可靠的工程范式。

发现相似论文

试试这些示例

  • 查找最近一年中,除了 FALCON 之外,还有哪些人形机器人全身控制(WBC)框架能够有效处理非预期的外部接触力?
  • 哪篇论文最早在腿足机器人领域提出了 Teacher-Student 蒸馏结合 DAgger 的视觉导航范式,本文在视觉噪声建模上有何改进?
  • 有哪些研究探讨了将 VOFA 这种目标导向的推物能力扩展至多物体管理或复杂障碍物环境中的物体重排空间?
目录
VOFA:让双足机器人像人一样推重物,力自适应与视觉闭环的完美融合
1. TL;DR
2. 痛点深挖:为什么“推重物”对人形机器人这么难?
3. 核心方法论:分层治理,力觉与视觉双修
3.1. 1. 底层:力自适应全身控制 (Force-Adaptive WBC)
3.2. 2. 高层:基于蒸馏的视觉策略
4. 实验战绩:突破载荷极限
5. 深度洞察与总结