[CVPR 2026] CoWVLA:像人类一样思考,在潜运动空间构建机器人的“世界之链”
Chain of World: World Model Thinking in Latent Motion
本文提出 CoWVLA (Chain-of-World VLA),这是一种全新的具身智能预训练范式,旨在统一世界模型的时序推理能力与潜空间动作(Latent Action)的紧凑表示,通过预测连续潜运动链和终端关键帧来实现高效的视觉运动学习。
TL;DR
传统的具身智能模型 (VLA) 要么像“像素搬运工”一样吃力地重建视频里的每一个背景像素,要么像“近视眼”一样只看瞬时的两帧变化。CoWVLA (Chain-of-World VLA) 提出了 Chain-of-World 范式:放弃无意义的背景重建,转而在解耦的潜空间中预测连续的运动轨迹(Motion Chain)和任务终点。这一改进让机器人在处理复杂操作时,拥有了类似人类的“预判”能力,且推理效率大幅提升。
核心动机:像素重建是世界模型的浪费吗?
目前主流的世界模型(如 WorldVLA, UniVLA)通过预测未来图像帧来学习环境动态。然而,这种方法的 Inductive Bias 存在明显偏差:
- 冗余开销:视频中 90% 的像素(背景)是静止的,模型却花费大量算力去复述这些像素,而非关注真正发生交互的运动部分。
- 时序短视:现有的潜空间方法通常只建模 到 的变换,缺乏对一段连续动作(如“拿起杯子并放到托盘”)的整体动态感知。
作者给出的 Insight 是:有效的工作记忆应该建模“什么在动”以及“动向哪里”,而不是重新粉刷整个房间。
技术内幕:解耦结构与运动的“世界之链”
1. 潜运动提取器 (Latent Motion Extractor)
CoWVLA 使用了一个特殊的 Video VAE (基于 VidTwin),它将一段视频片段显式分解为两个部分:
- 结构潜向量 ():捕捉全局场景布局、物体外观等静态信息。
- 运动潜向量 ():捕捉机器人手臂的轨迹和细粒度的时序动态。

2. 两阶段预训练策略
- 预训练阶段 (Thinking in Motion):模型接收初始帧和语言指令,通过一个
Motion Query预测整段动作的潜运动向量 以及最终的终端帧 。这让模型在开始动之前,脑子里已经有了“预演”。 - 微调阶段 (Co-Fine-Tuning):将潜动态推理与离散动作预测对齐。在稀疏的关键帧观测下,利用学到的动态先验来稳定地生成多步动作流。
实验战绩:SOTA 与物理直觉的胜利
CoWVLA 在 LIBERO (模拟多任务学习) 和 SimplerEnv (跨域真机模拟) 表现出色。

- 性能领先:相比于直接预测动作的 OpenVLA 或预测所有中间帧的 UniVLA,CoWVLA 在跨域鲁棒性上展现了巨大的优势。
- 可视化洞察:作者展示了令人惊叹的“交叉重建”效果——提取 A 视频的结构,注入 B 视频的运动向量,模型能完美合成出“穿着 A 衣服做 B 动作”的画面,证明了 确实精准捕捉了物理位移。

总结与局限性
CoWVLA 的成功在于其对“世界模型”进行了成功的“瘦身”。它不再追求像素级的完美,而追求语义与动态的逻辑闭环。
未来挑战:该模型目前仍依赖于大规模 VLA Backbone (8.5B Emu3),对于算力受限的任务场景,如何实现模型的轻量化,并将这种“潜动态逻辑”迁移到毫秒级控制响应中,将是下一步的研究重点。
Takeaway: 真正的具身智能不需要看到每一个像素的未来,它只需要预判动作轨迹,并在关键节点进行视觉校准。CoWVLA 正是顺着这一物理直觉,为 VLA 的下一步进化指明了方向。
