[CVPR 2026] JALA:告别像素重建,开启 VLA 预训练的大规模“野外”进化
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
本文提出了 JALA (Joint-Aligned Latent Action),一种新型的视觉-语言-动作 (VLA) 预训练框架。该方法通过将 VLA 上下文生成的预测嵌入与逆动力学推导的隐式动作进行联合对齐,成功利用了包含 750 万样本、超过 2000 小时的混合人类视频数据集 UniHand-Mix(包含实验室精确标注及野外无标注视频),在手部动作生成及机器人操作任务上达到了 SOTA 水平。
TL;DR
在机器人领域,数据即是绝对的生产力。然而,精确标记的机器人交互数据极其昂贵。JALA (Joint-Aligned Latent Action) 提供了一种巧妙的方案:通过“联合对齐”机制,让模型直接从海量无标签的互联网人类视频中学习动作规律。它不强求模型去预测每一个像素的颜色(那是世界模型的活儿),而是要求模型预测一种“动作嵌入”,并将其与视觉变化产生的“动力学信号”对齐。配合 7.5M 样本的 UniHand-Mix 数据集,JALA 在多项基准测试中刷新了 SOTA 纪录。
背景定位:从“看图说话”到“看图动眼”
目前的视觉-语言-动作模型 (VLA) 大多借鉴了 GPT 的思路,将动作 Token 化后进行预测。但在预训练阶段,我们面临严重的数据断层:
- 实验室数据 (Lab Data):虽有 3D 手部动作标签,但场景单一,模型容易过拟合到实验室的桌子上。
- 野外视频 (In-the-wild Data):例如 Ego4D,场景无穷无尽,但没有动作标签。
此前的 SOTA 方法(如 LAPA)尝试通过“重建未来帧”来提取隐式动作。但问题在于,手部动作太精细,重建视频往往模糊不清,导致学到的动作空间充满了噪声。
核心直觉:不需要画出未来,只需要预测动作
JALA 的核心逻辑在于:人类学习操作是通过捕捉可迁移的动作模式,而不是背诵每一个视觉细节。

1. 预测嵌入(Predictive Embedding)
JALA 使用 Transformer 架构的中间隐藏状态作为 h (Predictive Embedding)。
- 对于有标签数据,它负责预测动作 Token。
- 对于无标签视频,它通过
Align损失与z(Latent Action) 强行同步。
2. 隐式动作感知器 (LAP & LSP)
为了从视觉变化中提取动作,JALA 引入了两个感知器:
- LAP (Latent Action Perceiver):观察一帧前和一帧后的变化,输出隐式动作
z。 - LSP (Latent State Perceiver):注入初始帧上下文,辅助对齐。 为了防止训练坍塌,作者设计了解耦的 EMA 更新:LAP 学习动作锚点,LSP 将其映射回 VLA 的上下文空间,两者互补而不冲突。
实验战绩:野外生长的强大泛化力
JALA 在评估中展示了惊人的跨域泛化能力。在针对手部动作生成的测试中,JALA 在“野外测试集”上的表现远超同类模型。

- 性能起飞:在 Libero-Long 这种长任务序列中,JALA-dino 达到 96.0% 的成功率,显著高于基线模型。
- 高效预训练:对比重建法,JALA 的训练时间缩短了 20% 以上,因为它不需要庞大的视频解码器和像素生成损耗。
- 真实世界部署:在包含“递水果”、“擦白板”、“喷淋植物”的实机任务中,JALA 显示出极强的鲁棒性。即便更换了桌布纹理或记号笔颜色,它依然能通过自修正(Self-correction)完成任务。

深度洞察:为什么 JALA 能够 Scaling?
JALA 的成功揭示了一个关键趋势:VLA 预训练的瓶颈不在于视觉理解,而在于动作语义的提取精度。
- 通过 Masked Chunk Prediction (MCP),模型学到了动作的时序一致性。
- 通过 Joint Alignment,模型将互联网海量像素流转化为了低维的、结构化的动作流。
这种“行为中心”的表示学习,摒弃了过重的像素重建负担,使得 VLA 模型能够真正“吞噬”数千小时的野外视频,而不会被背景中的猫猫狗狗干扰了动作识别。
总结与局限
JALA 成功打通了人类视频到机器人动作的“隐式通道”。但目前的局限在于,对于极细微的力反馈(如物体滑落感)以及复杂的物体可见性推理,仍有改进空间。未来的方向可能在于引入更强的空间表征(如 3D Gaussians)来进一步增强 JALA 的对齐效果。
Takeaway: 预训练不需要“重塑世界”,只需要“对齐动作”。
