[CVPR 2026] World2Act: 告别像素幻觉,利用潜空间对齐重塑 VLA 策略后训练

World2Act: Latent Action Post-Training via Skill-Compositional World Models

总结
问题
方法
结果
要点
摘要

本文提出了 World2Act,一个用于 Vision-Language-Action (VLA) 策略后训练(Post-training)的框架,通过对比匹配机制将 VLA 的动作空间与世界模型(World Models, WM)的视频动力学潜空间(Latent Space)直接对齐。实验证明,该方法在 RoboCasa 和 LIBERO 模拟器及真实机器人任务中均达到 SOTA,并显著提高了具身智能体的泛化能力。

TL;DR

在 Embodied AI 领域,利用世界模型(World Models)进行仿真数据增强已成为主流。然而,生成的视频往往包含“幻觉”像素。World2Act 另辟蹊径,抛弃脆弱的像素端监督,通过潜空间对比学习将 VLA 模型的动作直接与世界模型的动力学特征对齐。配合创新的技能分解流水线,该方法在 RoboCasa 和 LIBERO 等基准上刷新了记录。

1. 痛点:被“幻觉”像素绊倒的机器人

目前提升 Vision-Language-Action (VLA) 模型性能的常用做法是“后训练”。即利用世界模型生成想象的执行视频,然后通过逆动力学模型(IDM)从视频中提取伪标签(Pseudo-labels)来微调策略。

但这种路径存在两个致命伤:

  1. 像素偏见:模型生成的视频在长程任务中容易产生漂移和幻觉。如果机器人策略盲目跟随这些错误的像素细节,性能反而会下降。
  2. 长度约束:视频生成模型通常在固定帧数上预训练,而机器人任务的跨度可能从几十秒到几分钟不等,直接生成长视频会导致严重的物理不一致。

2. World2Act:透过现象看本质的“潜空间对齐”

World2Act 的直觉在于:世界模型的中间层潜变量(Latents)比最终生成的像素包含更纯净、更稳定的物理动力学先验。

2.1 架构解析

该框架分为两个核心阶段:

  • 阶段 1:构建桥接适配器(Bridge Adapters)。训练视频适配器(Bv)和动作适配器(Ba),通过双向 InfoNCE 损失,将视频的潜特征与机器人的动作序列拉近到同一个高维空间。在此过程中,特别引入了“困难负采样”来增强区分细微动作的能力。
  • 阶段 2:潜空间动作后训练。冻结基准 VLA 模型,引入一个轻量级的残差策略(Residual Policy)。在机器人执行任务时,残差策略会根据世界模型预演的“视觉潜变量”来修正基准模型的动作输出。

模型架构图 图 1: World2Act 的两阶段对齐与后训练流程。注意其核心在于避开了像素解码过程。

3. 技能组合:让生成不再受限

为了解决长短不一的任务执行问题,作者开发了一套基于 DeepSeek-R1 的自动技能分解流水线。

  • 原理:通过监测机械臂夹爪的闭合信号识别物理交互边界,结合 LLM 将高层指令(如“把杯子放进微波炉”)分解为原子技能(如“抓取杯子”、“移动至微波炉”)。
  • 成果:开源了 RoboCasa-SkillLIBERO-Skill 数据集。这种“分解-组合”的策略使得世界模型只需专注生成短促、高质量的片段,再通过自回归方式拼接,完美解决了长程任务的一致性问题。

长度分布对比 图 2: 技能分解后,原本长尾分布的数据变为了集中的单峰分布,极大稳定了生成质量。

4. 实验战绩:SOTA 与物理鲁棒性

在 RoboCasa 厨房场景中,World2Act 显著优于之前的 DreamGen 和 VLA-RFT 等方法。

关键观察:

  • 正相关性:实验证明,视频与动作的余弦相似度(Cosine Similarity)越高,最终的成功率提升越明显。
  • 计算效率:相比于直接用 LoRA 微调数亿参数的 VLA 导致巨大开销,World2Act 的残差学习方法由于只需对基准模型进行前向传播,训练速度提升了 2.25倍

实验结果对比 图 3: 真实世界任务演示。即便生成视频中的把手消失了(像素幻觉),机器人依然能凭借潜空间中的动力学先验完成关门动作。

5. 资深主编点评 (Critical Analysis)

World2Act 标志着具身智能后训练技术从“像素模仿”向“语义对齐”的范式转变。其最大的价值在于容错性:它承认了世界模型在生成极端拟真细节上的无能(Hallucinations),但通过提取其对物理演变趋势(Dynamics)的本质理解,成功赋予了策略更强的泛化能力。

未来的挑战: 虽然潜空间缓解了视觉噪点,但当世界模型对极其精细的物理接触(如旋转微小的旋钮)预测失败时,这种对齐依然会失效。如何将触觉或多模态反馈进一步融入这个对齐空间,将是走向“物理通才”的下一站。

6. 总结

World2Act 证明了在物理世界中,“理解意图”比“绘制细节”更重要。这种基于潜空间的对比学习框架,为大规模利用生成式世界模型优化机器人控制提供了一套高效、鲁棒的标准方案。

发现相似论文

试试这些示例

  • 查找最近其他试图在潜空间(Latent Space)而非像素空间进行视频-动作对齐的具身智能论文。
  • 哪篇论文最早提出了“残差策略学习 (Residual Policy Learning)”并在具身智能领域被广泛应用,本文是如何改进其效率的?
  • 有哪些研究探讨了大型语言模型(LLM)在机器人任务分解(Task Decomposition)中的自动化标注可靠性评估?
目录
[CVPR 2026] World2Act: 告别像素幻觉,利用潜空间对齐重塑 VLA 策略后训练
1. TL;DR
2. 1. 痛点:被“幻觉”像素绊倒的机器人
3. 2. World2Act:透过现象看本质的“潜空间对齐”
3.1. 2.1 架构解析
4. 3. 技能组合:让生成不再受限
5. 4. 实验战绩:SOTA 与物理鲁棒性
6. 5. 资深主编点评 (Critical Analysis)
7. 6. 总结