[2026] UltraDexGrasp:突破双臂灵巧抓取极限,2000万帧数据驱动的通用策略
UltraDexGrasp: Learning Universal Dexterous Grasping for Bimanual Robots with Synthetic Data
本文提出了 UltraDexGrasp,这是一个针对双臂机器人通用灵巧抓取的研究框架。通过集成基于优化的抓取合成与基于路径规划的演示生成,作者构建了包含 2000 万帧的大规模多策略数据集 UltraDexGrasp-20M,并训练出一种在真实世界中具备 81.2% 成功率的 Zero-shot 闭环控制策略。
TL;DR
UltraDexGrasp 是一项针对双臂机器人通用抓取的突破性工作。它不仅开源了首个大规模双臂灵巧抓取数据集 UltraDexGrasp-20M,还设计了一个能够根据物体形状、重量自动选择“捏、握、抱”等不同模式的闭环控制策略。该策略在真实世界中达到了 81.2% 的抓取成功率,且完全基于仿真数据训练,展现了极强的 Zero-shot Sim-to-Real 迁移能力。
痛点深挖:为什么双臂灵巧抓取这么难?
在机器人领域,让机器人像人一样用两只手灵活抓取物体一直是“圣杯”级别的挑战。目前的局限性主要体现在:
- 数据鸿沟:灵巧手有极高的自由度(DoF),通过遥操作采集双臂协同数据成本极高。
- 策略单一:现有方法多针对单手抓取,无法处理超出单手尺寸的大型物体,也无法在“精细捏取”和“大负载抱持”之间灵活切换。
- 泛化瓶颈:面对从未见过的物体,如何保证抓取的物理稳定性(Force Closure)并避开自碰撞?
作者认为,解决之道的关键在于数据的规模化与多样性,以及一种能感知几何细节的通用策略架构。
核心方法:UltraDexGrasp 流水线
1. 多策略合成数据生成
UltraDexGrasp 的核心在于一套自动化的数据流水线(Pipeline)。它将抓取过程分为两个阶段:
- 抓取合成(Synthesis):利用双层优化(Bilevel Optimization)计算最优触点。上层优化手部姿态(Pose),下层通过二次规划(QP)求解满足摩擦锥约束的接触力。
- 演示生成(Demonstration):使用
cuRobo库进行并行化的双臂碰撞检查和路径规划。
通过这套流程,研究人员针对 1,000 个物体生成了涵盖:**二指捏(Pinch)、三指鼎立(Tripod)、全掌抓(Whole-hand)和双臂抱(Bimanual)**四种策略的 2000 万帧数据。
图 1:UltraDexGrasp 数据流水线:从场景初始化到优化合成,再到路径规划。
2. 指尖触点定义的物理直觉
为了支持多策略,作者巧妙地定义了不同的活跃触点集(Active Contact Set)。例如,精细操作仅激活指尖触点,而大物体抓取则激活整个掌心和双臂的受力面积。
图 2:针对不同策略(捏、取、抱)定义的特定手部接触点。
策略架构:感知即控制
模型的策略架构追求“大巧若拙”。它直接以点云(Point Cloud)作为输入:
- 特征提取:使用 PointNet++ 提取场景的层级特征。
- 注意力机制:通过 Transformer Decoder 中的单向注意力(Unidirectional Attention)将动作 Query 与点云特征融合。
- 概率建模:预测动作的有界高斯分布。这种随机性建模相比直接回归坐标,在处理多模态数据(即一个物体有多种合理抓法)时表现更稳定。
图 3:通用灵巧抓取策略架构:点云输入 -> PointNet++ -> Transformer -> 动作分布。
实验与结果:全方位的 SOTA
仿真性能
在 600 个测试物体(包含从未在训练集出现的类别)中,UltraDexGrasp 的表现令人惊艳:
- 平均成功率 84.0%,远超扩散策略基线 DP3 (46.7%) 和 基于优化的 DexGraspNet (58.8%)。
- 尺寸泛化:无论是长边小于 3cm 的微型部件,还是短边超过 50cm 的大箱子,系统都能稳定处理。
真实世界 Sim-to-Real
实验采用了两台 UR5e 机械臂和 XHand 灵巧手。通过加入机器人本体点云渲染(Imaged Point Cloud)和关节阻抗随机化,模型成功克服了现实世界的噪声。
图 4:真实世界实验设置,涵盖了从轻质物体到重型容器的各种挑战。
| 策略 | 小物体 | 中物体 | 大物体 | 平均 |
|---|---|---|---|---|
| DP3 | 37.3% | 56.0% | 46.7% | 46.7% |
| Ours | 72.0% | 82.2% | 89.3% | 81.2% |
深度洞察与总结
UltraDexGrasp 的成功揭示了两个重要趋势:
- 合成数据的威力:对于复杂的双臂协同,真实数据的匮乏可以通过高性能物理仿真与先进优化算法产生的“合成专家演示”来弥补。
- 多策略融合的必然性:真正的通才机器人不应局限于一种抓取模式。UltraDexGrasp 通过统一的优化框架实现了策略的语义对齐,为未来更通用的具身智能(Generalist Embodied AI)奠定了基础。
局限性:目前系统主要关注抓取瞬间及其稳定性,对于抓取后的动态操控(如旋转物体、复杂的工具使用)仍有待进一步探索。
