像素到 Token:VLA 模型中隐动作监督的系统综述

From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models

总结
问题
方法
结果
要点
摘要

本文对视觉-语言-动作(VLA)模型中的隐动作(Latent Action)监督策略进行了系统性研究,提出了基于图像(Image-based)和基于动作(Action-based)的两种监督视角,并对比了四种集成策略。研究表明,直接预测离散隐动作 Token 能显著提升模型在长程推理和复杂电机控制任务中的性能,在 LIBERO 和 RoboTwin 等基准测试中达到了 SOTA 水平。

TL;DR

在具身智能(Embodied AI)飞速发展的今天,Vision-Language-Action (VLA) 模型如 Google 的 RT 系列、OpenVLA 等已成为通用机器人策略的标准范式。然而,面对数据来源极其混杂的现状,如何有效地监督这些模型?本文系统地探讨了 Latent Action (隐动作) 的监督艺术。研究发现:不要让模型直接去猜坐标值,而是让它先去预测离散的隐动作 Token,这一简单的改变能让模型在复杂任务中的成功率最高提升 17.5%。

痛点深挖:异质数据的“巴别塔”

当前 VLA 训练面临的最大挑战是数据的异质性 (Heterogeneous)。不同机器人平台的自由度不同,甚至人类视频完全没有动作标注。如果直接训练预测连续坐标(Continuous Action),模型会陷入语义失配的泥潭。

虽然业界已经开始尝试使用隐动作作为“中间语言”,但做法五花八门:有的是作为辅助损失,有的是作为生成的预览图。作者通过这篇论文,为这片混乱的领域建立了“统一坐标系”。

核心洞察:两种视角,四种策略

作者将 Latent Action 的应用统一为两个互补的逻辑:

  1. 轨迹正则化 (Regularizing the Trajectory):这是一种“前向映射”,把隐动作看作高层视觉规划(Visual Plans),告诉 VLM 应该往哪走。
  2. 目标空间统一 (Unifying the Target Space):这是一种“逆向映射”,把复杂的连续动作压缩进 VLM 原生的 Token 空间,让动作预测像写文章一样简单。

模型架构与策略分类

基于此,作者在 Qwen-VL 基础上实现了四种集成方案(LA-Align, LA-Direct, LA-Cond, LA-Tok),并发现了一个及其关键的**“形式-任务对应关系”**。

实验揭秘:谁才是最强监督?

1. 不同任务,不同配方

  • 长程推理(Long-horizon):在 LIBERO-Long 实验中,图像基隐动作表现抢眼。因为它通过视觉状态转移(Visual State Transition)为模型提供了全局视野。
  • 复杂电机控制(Motorically Complex):在涉及到双臂协同的 RoboTwin 实验室中,**动作基隐动作(LA-Tok)**一骑绝尘。通过将频率域和时域特征结合,它捕捉到了动作的精细抖动。

四种策略的实例化架构图

2. 离散 Token 完胜连续回归

这是一个反直觉但深刻的结论:在 VLM 内部,使用 Cross-Entropy 损失去预测离散 Token,总是比使用 MSE 损失去回归一个连续向量效果更好(在基准测试中平均高出 2% 以上)。这表明 VLM 更擅长处理分类任务,而分类任务的离散瓶颈(Bottleneck)起到了正则化作用,过滤了动作中的噪声。

3. 加入隐动作后的“抗干扰”能力

在 10 个任务的联合训练中,普通的 Baseline 往往会出现“拆东墙补西墙”的负迁移现象。但引入 LA-Cond 策略后,所有任务的成功率均单调提升。这说明隐动作为异质数据集提供了统一的建模范式,降低了学习冲突。

RoboTwin 2.0 任务对比表格

深度分析:未来 VLA 该怎么训?

本文不仅是实验报告,其实是一份实战避坑指南:

  • 如果你希望机器人更“聪明”(懂规划):选 LA-Direct,让模型预测未来的隐视觉特征。
  • 如果你希望机器人更“灵活”(懂协调):选 LA-Tok,把动作揉碎成 Token。
  • 不要盲目增加 Placeholder 长度:实验证明,单纯增加 Token 长度而不引入 Latent 监督,性能几乎没有提升。

总结与局限

作者建立了一个极其纯净的对比实验环境,隔离了参数量、主干网络带来的干扰。虽然目前实验还局限于单臂机器人,但这套理论框架对于未来构建更庞大的通用具身智能(Generalist Robotics)模型具有重要的启发意义。正如论文标题所言:从像素到 Token 的跨越,可能正是填补“看懂”与“做到”之间鸿沟的关键。

发现相似论文

试试这些示例

  • 查找最近一年内其他探讨视觉-语言-动作模型中动作离散化(Action Tokenization)技术的 SOTA 论文。
  • 追溯 UniVLA 和 LAPA 论文的核心架构,分析本文提出的 LA-Direct 策略是如何在这些方法基础上进行简化与统一归纳的?
  • 调研是否存在将层级化隐动作(Hierarchical Latent Actions)应用于解决具身智能模型中跨具身(Cross-embodiment)通用化问题的相关研究。
目录
像素到 Token:VLA 模型中隐动作监督的系统综述
1. TL;DR
2. 痛点深挖:异质数据的“巴别塔”
3. 核心洞察:两种视角,四种策略
4. 实验揭秘:谁才是最强监督?
4.1. 1. 不同任务,不同配方
4.2. 2. 离散 Token 完胜连续回归
4.3. 3. 加入隐动作后的“抗干扰”能力
5. 深度分析:未来 VLA 该怎么训?
6. 总结与局限