[CVPR 2026] JALA:告别像素重建,开启 VLA 预训练的大规模“野外”进化

Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

总结
问题
方法
结果
要点

本文提出了 JALA (Joint-Aligned Latent Action),一种新型的视觉-语言-动作 (VLA) 预训练框架。该方法通过将 VLA 上下文生成的预测嵌入与逆动力学推导的隐式动作进行联合对齐,成功利用了包含 750 万样本、超过 2000 小时的混合人类视频数据集 UniHand-Mix(包含实验室精确标注及野外无标注视频),在手部动作生成及机器人操作任务上达到了 SOTA 水平。

TL;DR

在机器人领域,数据即是绝对的生产力。然而,精确标记的机器人交互数据极其昂贵。JALA (Joint-Aligned Latent Action) 提供了一种巧妙的方案:通过“联合对齐”机制,让模型直接从海量无标签的互联网人类视频中学习动作规律。它不强求模型去预测每一个像素的颜色(那是世界模型的活儿),而是要求模型预测一种“动作嵌入”,并将其与视觉变化产生的“动力学信号”对齐。配合 7.5M 样本的 UniHand-Mix 数据集,JALA 在多项基准测试中刷新了 SOTA 纪录。

背景定位:从“看图说话”到“看图动眼”

目前的视觉-语言-动作模型 (VLA) 大多借鉴了 GPT 的思路,将动作 Token 化后进行预测。但在预训练阶段,我们面临严重的数据断层

  • 实验室数据 (Lab Data):虽有 3D 手部动作标签,但场景单一,模型容易过拟合到实验室的桌子上。
  • 野外视频 (In-the-wild Data):例如 Ego4D,场景无穷无尽,但没有动作标签。

此前的 SOTA 方法(如 LAPA)尝试通过“重建未来帧”来提取隐式动作。但问题在于,手部动作太精细,重建视频往往模糊不清,导致学到的动作空间充满了噪声。

核心直觉:不需要画出未来,只需要预测动作

JALA 的核心逻辑在于:人类学习操作是通过捕捉可迁移的动作模式,而不是背诵每一个视觉细节。

模型架构图

1. 预测嵌入(Predictive Embedding)

JALA 使用 Transformer 架构的中间隐藏状态作为 h (Predictive Embedding)。

  • 对于有标签数据,它负责预测动作 Token。
  • 对于无标签视频,它通过 Align 损失与 z (Latent Action) 强行同步。

2. 隐式动作感知器 (LAP & LSP)

为了从视觉变化中提取动作,JALA 引入了两个感知器:

  • LAP (Latent Action Perceiver):观察一帧前和一帧后的变化,输出隐式动作 z
  • LSP (Latent State Perceiver):注入初始帧上下文,辅助对齐。 为了防止训练坍塌,作者设计了解耦的 EMA 更新:LAP 学习动作锚点,LSP 将其映射回 VLA 的上下文空间,两者互补而不冲突。

实验战绩:野外生长的强大泛化力

JALA 在评估中展示了惊人的跨域泛化能力。在针对手部动作生成的测试中,JALA 在“野外测试集”上的表现远超同类模型。

实验结果对比

  • 性能起飞:在 Libero-Long 这种长任务序列中,JALA-dino 达到 96.0% 的成功率,显著高于基线模型。
  • 高效预训练:对比重建法,JALA 的训练时间缩短了 20% 以上,因为它不需要庞大的视频解码器和像素生成损耗。
  • 真实世界部署:在包含“递水果”、“擦白板”、“喷淋植物”的实机任务中,JALA 显示出极强的鲁棒性。即便更换了桌布纹理或记号笔颜色,它依然能通过自修正(Self-correction)完成任务。

真实世界成果

深度洞察:为什么 JALA 能够 Scaling?

JALA 的成功揭示了一个关键趋势:VLA 预训练的瓶颈不在于视觉理解,而在于动作语义的提取精度。

  • 通过 Masked Chunk Prediction (MCP),模型学到了动作的时序一致性。
  • 通过 Joint Alignment,模型将互联网海量像素流转化为了低维的、结构化的动作流。

这种“行为中心”的表示学习,摒弃了过重的像素重建负担,使得 VLA 模型能够真正“吞噬”数千小时的野外视频,而不会被背景中的猫猫狗狗干扰了动作识别。

总结与局限

JALA 成功打通了人类视频到机器人动作的“隐式通道”。但目前的局限在于,对于极细微的力反馈(如物体滑落感)以及复杂的物体可见性推理,仍有改进空间。未来的方向可能在于引入更强的空间表征(如 3D Gaussians)来进一步增强 JALA 的对齐效果。

Takeaway: 预训练不需要“重塑世界”,只需要“对齐动作”。

发现相似论文

试试这些示例

  • 查找最近一年内除了 JALA 之外,其他探索非重建式(Non-reconstruction)隐式动作空间学习的 VLA 预训练论文。
  • 追溯逆动力学模型(Inverse Dynamics Model)在具身智能中的演进过程,特别是 LAP 模块所借鉴的 Perceiver 架构在动作表示学习中的首次应用及其改进方向。
  • 研究如何将 JALA 这种联合对齐的预训练权重应用到除机械臂操作外的任务中,例如四足避障或类人机器人全身协同控制。
目录
[CVPR 2026] JALA:告别像素重建,开启 VLA 预训练的大规模“野外”进化
1. TL;DR
2. 背景定位:从“看图说话”到“看图动眼”
3. 核心直觉:不需要画出未来,只需要预测动作
3.1. 1. 预测嵌入(Predictive Embedding)
3.2. 2. 隐式动作感知器 (LAP & LSP)
4. 实验战绩:野外生长的强大泛化力
5. 深度洞察:为什么 JALA 能够 Scaling?
6. 总结与局限