[ICRA 2025] DAM-VLA:基于动态动作路由与双尺度加权的机器人操纵新范式

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

总结
问题
方法
结果
要点
摘要

本文提出了 DAM-VLA,一种基于动态动作模型的视觉-语言-动作框架。该框架通过结合 Vision-Language Model (VLM) 的高层推理能力与专门化的 Diffusion-based 动作模型,在 SIMPLER 和 FurnitureBench 等基准测试中刷新了 SOTA 记录。

TL;DR

在机器人学中,让模型同时具备“全局路径规划”的战略眼光和“精密夹取”的战术精度是一个经典矛盾。本文提出的 DAM-VLA (Dynamic Action Model-based VLA) 通过引入一个智能路由机制,让 VLM 动态指挥不同的 Diffusion 动作头部。它在保持 VLM 泛化能力的同时,通过视觉特征的精细化注入(Class vs. Register tokens),在长程任务和复杂接触任务(如拧螺丝)中表现出了惊人的 SOTA 性能。

痛点深挖:通用性与精密性的“鱼与熊掌”

目前的 Vision-Language-Action (VLA) 模型虽然在多任务泛化上取得了突破,但在实际部署中面临三个核心痛点:

  1. 空间尺度差异:手臂大范围移动(Arm Movement)需要全局环境感知,而夹爪精细操作(Gripper Manipulation)则需要极高分辨率的局部注意力。
  2. 约束强度不同:手臂轨迹通常有多种解,而夹爪的姿态一旦偏差几毫米就会导致失败。
  3. 数据分布极度不均:在 Open X-Embodiment 等数据集中,移动阶段的数据远多于接触操作阶段,导致模型在关键的收尾环节极易“手抖”。

动作类型区别分析

核心方法:DAM-VLA 架构解析

DAM-VLA 的核心思想是**“分而治之,动态指挥”**。其架构主要由三个关键创新点组成:

1. 动作路由机制 (Action Routing)

传统的 VLA 模型是一股脑输出动作。DAM-VLA 利用 LLaMA-2 骨干网络的中间层(Reasoning Latent)来预测一个权重值

  • 如果 ,激活手臂运动模型(全局视野,低精度约束)。
  • 如果 ,激活夹爪操纵模型(局部视野,高精度约束)。

2. 动态动作模型与视觉注入

为了给不同的动作头部提供最合适的视觉养料,作者利用了 DINOv2 生成的特征:

  • 手臂模型:输入 f_cls (Class Token),提供宏观语义和全图特征。
  • 操纵模型:输入 f_reg (Register Token),捕捉精细的局部几何关系。

模型总架构图

3. 双尺度动作加权 (Dual-Scale Weighting)

为了让两个动作模型在切换时平滑且鲁棒,系统在训练时采用了:

  • 轨迹级权重 (Trajectory-level):基于夹爪开合状态,利用非对称高斯分布在状态转换点进行加权。
  • 动作块级权重 (Action-chunk-level):对未来动作序列进行指数衰减加权,强调近处动作的准确性。

实验战绩:全线 SOTA

SIMPLER 仿真中,DAM-VLA 展示了强大的性能:

  • 在 Google 机器人的“打开抽屉放苹果”任务(极具挑战性的接触任务)中,相比之前的最优模型 CogACT,成功率实现了翻倍增长。
  • 在 WidowX 机器人数据集上,平均成功率从 57% 提升到了 71%

仿真实验结果对比

在代表长跨度复杂任务的 FurnitureBench(家具组装)中,DAM-VLA 更是完成了 OpenVLA 难以企及的任务。尤其在“将腿旋入螺孔 (Screw Leg)”这一步骤中,表现出极强的力控和精确位姿调整能力。

深度洞察与总结

DAM-VLA 的成功不仅在于它用了更强的 Diffusion 模型,更在于它对机器人物理任务的分阶段理解。通过将 VLM 定义为“决策层/指挥官”,将 Diffusion 定义为“执行层/专家组”,它成功解决了通用语言理解与低层运动控制之间的阻抗匹配问题。

局限性与展望: 目前该模型仅在“手臂”和“夹爪”两个角色间切换。未来的研究方向在于如何扩展路由机制,以支持如“单手 vs. 双手”、“接触 vs. 非接触”等更复杂的多模态动作模式切换。对于寻求在动态、未见环境下部署机器人的团队来说,DAM-VLA 提供的双尺度加权训练方案极具借鉴价值。

真实世界泛化实验

发现相似论文

试试这些示例

  • 查找最近其他尝试通过将机器人动作空间分解为多个子模型(如层次化强化学习或多头部策略)来提高操纵精度的论文。
  • 哪篇论文最早在机器人视觉模型中引入了 DINOv2 的 Register tokens,本文对于 Register tokens 辅助局部操纵的直觉是否有相关理论支持?
  • 有哪些研究将 Diffusion-based VLA 架构应用到了双臂协同或其他更复杂的接触密集型(Contact-rich)任务中?
目录
[ICRA 2025] DAM-VLA:基于动态动作路由与双尺度加权的机器人操纵新范式
1. TL;DR
2. 痛点深挖:通用性与精密性的“鱼与熊掌”
3. 核心方法:DAM-VLA 架构解析
3.1. 1. 动作路由机制 (Action Routing)
3.2. 2. 动态动作模型与视觉注入
3.3. 3. 双尺度动作加权 (Dual-Scale Weighting)
4. 实验战绩:全线 SOTA
5. 深度洞察与总结