[ICRA 2025] DAM-VLA:基于动态动作路由与双尺度加权的机器人操纵新范式
DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation
本文提出了 DAM-VLA,一种基于动态动作模型的视觉-语言-动作框架。该框架通过结合 Vision-Language Model (VLM) 的高层推理能力与专门化的 Diffusion-based 动作模型,在 SIMPLER 和 FurnitureBench 等基准测试中刷新了 SOTA 记录。
TL;DR
在机器人学中,让模型同时具备“全局路径规划”的战略眼光和“精密夹取”的战术精度是一个经典矛盾。本文提出的 DAM-VLA (Dynamic Action Model-based VLA) 通过引入一个智能路由机制,让 VLM 动态指挥不同的 Diffusion 动作头部。它在保持 VLM 泛化能力的同时,通过视觉特征的精细化注入(Class vs. Register tokens),在长程任务和复杂接触任务(如拧螺丝)中表现出了惊人的 SOTA 性能。
痛点深挖:通用性与精密性的“鱼与熊掌”
目前的 Vision-Language-Action (VLA) 模型虽然在多任务泛化上取得了突破,但在实际部署中面临三个核心痛点:
- 空间尺度差异:手臂大范围移动(Arm Movement)需要全局环境感知,而夹爪精细操作(Gripper Manipulation)则需要极高分辨率的局部注意力。
- 约束强度不同:手臂轨迹通常有多种解,而夹爪的姿态一旦偏差几毫米就会导致失败。
- 数据分布极度不均:在 Open X-Embodiment 等数据集中,移动阶段的数据远多于接触操作阶段,导致模型在关键的收尾环节极易“手抖”。

核心方法:DAM-VLA 架构解析
DAM-VLA 的核心思想是**“分而治之,动态指挥”**。其架构主要由三个关键创新点组成:
1. 动作路由机制 (Action Routing)
传统的 VLA 模型是一股脑输出动作。DAM-VLA 利用 LLaMA-2 骨干网络的中间层(Reasoning Latent)来预测一个权重值 。
- 如果 ,激活手臂运动模型(全局视野,低精度约束)。
- 如果 ,激活夹爪操纵模型(局部视野,高精度约束)。
2. 动态动作模型与视觉注入
为了给不同的动作头部提供最合适的视觉养料,作者利用了 DINOv2 生成的特征:
- 手臂模型:输入
f_cls(Class Token),提供宏观语义和全图特征。 - 操纵模型:输入
f_reg(Register Token),捕捉精细的局部几何关系。

3. 双尺度动作加权 (Dual-Scale Weighting)
为了让两个动作模型在切换时平滑且鲁棒,系统在训练时采用了:
- 轨迹级权重 (Trajectory-level):基于夹爪开合状态,利用非对称高斯分布在状态转换点进行加权。
- 动作块级权重 (Action-chunk-level):对未来动作序列进行指数衰减加权,强调近处动作的准确性。
实验战绩:全线 SOTA
在 SIMPLER 仿真中,DAM-VLA 展示了强大的性能:
- 在 Google 机器人的“打开抽屉放苹果”任务(极具挑战性的接触任务)中,相比之前的最优模型 CogACT,成功率实现了翻倍增长。
- 在 WidowX 机器人数据集上,平均成功率从 57% 提升到了 71%。

在代表长跨度复杂任务的 FurnitureBench(家具组装)中,DAM-VLA 更是完成了 OpenVLA 难以企及的任务。尤其在“将腿旋入螺孔 (Screw Leg)”这一步骤中,表现出极强的力控和精确位姿调整能力。
深度洞察与总结
DAM-VLA 的成功不仅在于它用了更强的 Diffusion 模型,更在于它对机器人物理任务的分阶段理解。通过将 VLM 定义为“决策层/指挥官”,将 Diffusion 定义为“执行层/专家组”,它成功解决了通用语言理解与低层运动控制之间的阻抗匹配问题。
局限性与展望: 目前该模型仅在“手臂”和“夹爪”两个角色间切换。未来的研究方向在于如何扩展路由机制,以支持如“单手 vs. 双手”、“接触 vs. 非接触”等更复杂的多模态动作模式切换。对于寻求在动态、未见环境下部署机器人的团队来说,DAM-VLA 提供的双尺度加权训练方案极具借鉴价值。

