[CVPR 2026 预测形态] UniHM: 摆脱遥操作焦虑,用 VLM 统合异构灵巧手的“言听计从”

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

总结
问题
方法
结果
要点
摘要

本文提出了 UniHM,这是首个由自由文本指令引导的统一灵巧手操作框架。通过引入“统一手部灵巧分词器(Unified Hand-Dexterous Tokenizer)”和物理导向的动态精炼模块,该方法在多种异构机器人手(如 Shadow hand, Allegro 等)上实现了超越静态抓取的连贯操作序列生成。

TL;DR

面对形态各异的机械手(Shadow, Allegro, LEAP 等),研究者们一直苦于无法建立统一的操控模型。UniHM (Unified Hand Manipulation) 横空出世,它通过一个“形态无关”的统一分词器,将异构手的关节语言翻译成同一种“方言”。不再需要昂贵的真人遥操作数据,只需通过人类视频学习和自由文本引导,即可生成物理可行的连贯操作轨迹。

背景定位:从“静态抓取”到“动态交互”的飞跃

以往的研究大多关注:如何稳固地抓起一个物体?(Static Grasping)。 而 UniHM 关注的是:“把那个瓶子抓起来放到盒子里”(Instruction-guided manipulation sequence)。它在学术坐标系中处于 Embodied AI 与跨形态泛化(Cross-embodiment Generalization) 的交叉点。


痛点深挖:为何灵巧手总是“手残”?

  1. 数据孤岛:每款机械手的自由度 (DoF) 和运动学逻辑都不同,数据无法互通。
  2. 物理断档:生成的动作在数学上看可行,但在物理世界中往往伴随着穿模、滑动或运动不平滑。
  3. 指令盲区:无法理解“轻拿轻放”这类开放语义,只能接受预定义的坐标输入。

核心机制:UniHM 的三大支柱

1. 统一手部灵巧分词器 (Unified Hand-Dexterous Tokenizer)

这是 UniHM 处理异构性的秘诀。它利用 VQ-VAE 将不同手的配置空间映射到一个共享的 Codebook 中。

  • 知识蒸馏对齐:当有一个新形态的机械手加入时,模型通过蒸馏已有手的 Latent Space,让新手的 Encoder 迅速学会“共享套路”。

模型架构图

2. 视觉-语言-动作统合 (VLM for Manipulation)

UniHM 采用了 Qwen3-0.6B 作为大脑。它解耦了“感知”与“决策”:

  • CLIPort 分支负责定位轨迹轨迹
  • VLM 主干负责生成符合指令的动作 Token 序列。 这种模块化设计意味着,当环境光照变化时,你只需要微调轻量的感知模块,而不需要重新训练昂贵的操作模型。

3. 物理导向的动态精炼 (Physics-Guided Refinement)

即便 VLM 生成了动作,也可能存在接触不良。作者引入了一个基于能量的优化目标

  • 接触能量 (Contact Energy):利用点到平面的带符号距离函数,强迫指尖贴合目标表面。
  • 时空先验 (Temporal Prior):通过惩罚加速度突变,确保机械手的动作像人类一样丝滑,而非生硬的步进。

实验战绩:全线飘红的泛化性能

UniHM 在 DexYCB 和 OakInk 两个高难度数据集上进行了验证。结果显示,它在 Seen(见过的物体)和 Unseen(陌生目标)上均展现了强大的竞争力。

实验结果对比

在真实世界测试中,对于复杂的“推拉抽屉”、“放置水果”等动作,UniHM 的成功率(Success Rate)大幅领先于 MDM 和 MotionGPT3 等基线。尤其在 Unseen 场景下,这种“举一反三”的泛化性正是具身智能迈向通用的关键。


深度洞察与总结

UniHM 的本质提升在哪里? 它最深刻的洞见在于通过离散化的动作 Token 实现了运动学的“语义化”。这让原本高度依赖几何精度的机器人控制,变得像自然语言生成一样具有组合性和容错性。

局限性:

  • 触觉缺失:目前依然高度依赖视觉输入(RGB-D),在涉及极端遮挡或需要力量微调的复杂交互中,缺乏力反馈(Tactile Sensing)可能导致稳定性下降。
  • 单手限制:目前主要针对单手操作,未来在双臂协作(Bimanual)方面仍有探索空间。

未来展望: 随着扩散模型(Diffusion Models)与 VLM 的进一步融合,UniHM 这种“分词+精炼”的策略可能会演变为更高效的端到端生成策略,为家庭服务机器人提供真正灵活的“双手”。

发现相似论文

试试这些示例

  • 查找最近其他试图利用人类视频交互数据(HOI)作为监督信号来训练机器人灵巧操作策略的论文。
  • 哪篇论文最早引入了 VQ-VAE 在跨形态机器人动作表达中的应用,UniHM 在代码本对齐上做了哪些改进?
  • 有哪些研究将类似 UniHM 的物理导向优化(Physics-guided Refinement)应用到了双臂协作或工具使用任务中?
目录
[CVPR 2026 预测形态] UniHM: 摆脱遥操作焦虑,用 VLM 统合异构灵巧手的“言听计从”
1. TL;DR
2. 背景定位:从“静态抓取”到“动态交互”的飞跃
3. 痛点深挖:为何灵巧手总是“手残”?
4. 核心机制:UniHM 的三大支柱
4.1. 1. 统一手部灵巧分词器 (Unified Hand-Dexterous Tokenizer)
4.2. 2. 视觉-语言-动作统合 (VLM for Manipulation)
4.3. 3. 物理导向的动态精炼 (Physics-Guided Refinement)
5. 实验战绩:全线飘红的泛化性能
6. 深度洞察与总结