Cortex 2.0:赋予工业机器人“预见性”,从响应式控制迈向潜空间规划
Cortex 2.0: Grounding World Models in Real-World Industrial Deployment
本文推出了 Cortex 2.0,这是一个工业级视觉-语言-动作(VLA)模型,旨在解决机器人长程任务中的可靠性问题。通过引入视觉潜空间的世界模型(World Model)和过程奖励算子(PRO),该模型实现了从“响应式控制”到“规划-执行”的转变,在单臂与双臂工业任务中刷新了 SOTA 记录。
TL;DR
Sereact 推出的 Cortex 2.0 标志着工业机器人控制架构的一次范式转移。它不仅仅是一个能够理解指令的生成式模型,更是一个具备“物理直觉”的规划器。通过在视觉潜空间模拟未来可能发生的多种场景,并利用 Process-Reward Operator (PRO) 筛选出最安全、最高效的路径,Cortex 2.0 在复杂的工业分拣任务中消灭了频繁的人工干预,实现了真正意义上的自主运行。
痛点深挖:为什么响应式 VLA 玩不转工业现场?
即便像 RT-2 或 OpenVLA 这样的大模型在泛化性上表现出色,但在处理“长程任务(Long-horizon tasks)”时却显得捉襟见肘。
- 不可逆性:工业场景下,一次错误的抓取可能导致零件掉落到无法触及的缝隙,或者撞坏传送带。
- 错误累积:响应式模型“走一步看一步”,一旦中间某环出现微小偏差(如物体滑动),后续动作往往会反复尝试错误动作,形成死锁。
- 因果缺失:它们缺乏对“如果我这么做,未来会怎样”的推理能力。

核心方法论:Cortex 2.0 的“大脑”解剖
Cortex 2.0 的核心在于将 世界模型(World Model) 与 过程奖励算子(PRO) 引入了 VLA 的循环中。
1. 视觉潜空间的世界模型 (World Model)
与其在昂贵的原始视频中进行像素级预测,Cortex 2.0 选择在由 VLM 编码后的 潜空间 (Latent Space) 内进行模拟。基于 Flow Matching 算法,模型可以并行生成 个候选未来轨迹。每一个轨迹都反映了在当前任务指令下,机器人动作可能导致的场景演化。
2. 过程奖励算子 (PRO):挑剔的“评审员”
这是 Cortex 2.0 最具工业价值的设计。PRO 包含三个专门的预测头,对 个候选轨迹进行全方位打分:
- Progress (进度):该动作是否让我离目标更近?
- Risk (风险):轨迹中是否包含高速碰撞、边缘刮擦或不稳定的接触?
- Termination (完结):这个分支最终通向成功的概率有多大?
系统最终会选择总分最高的轨迹 ,并以此通过 Advantage Signal (I_t) 来引导动作头执行。

实验与结果:统治级的工业表现
作者在四项极具挑战性的工业任务中进行了基准测试:
- 单臂取放:验证低数据下的适配能力。
- 物品/垃圾箱分拣:考察在杂乱环境下的分类与路径规划。
- 精密螺丝分拣:挑战亚毫米级的感知与控制精度。
- 鞋盒拆解:测试长涉及变形体(包装纸)和多步骤关联的任务。
关键战绩:
- 零干预率:在所有任务中,Cortex 2.0 是唯一不需要人工介入即可完成全流程的模型。相比之下,传统的 Diffusion Policy 在分拣任务中每轮可能需要多次干预。
- 计算与精度平衡:实验表明,随着采样轨迹数 的增加,成功率单调上升。在 时,成功率甚至逼近 100%,这为实际部署提供了灵活的算力调节杠杆。

深度洞察:跨具身的通用物理底座
Cortex 2.0 最令学术界兴奋的一点在于其 跨具身(Cross-embodiment) 的设计。由于规划是在视觉空间(Visual Space)进行的,机器人学的物理规律(如重力、碰撞、摩擦)在视觉表现上具有跨平台的一致性。
这意味着:为一个单臂协作机器人训练的世界模型和 PRO,经过极少量的微调甚至可以直接迁移到双臂机器人甚至人形机器人上。决定动作细节的“Action Mapping”被隔离在最底层,这极大地降低了新硬件的部署成本。
局限性与展望
尽管 Cortex 2.0 表现惊人,但其推理延迟随 的增加而线性增长,这在极高频实时控制中仍是挑战。作者未来的方向是致力于 In-context Learning —— 即让机器人只需看一眼人类的操作视频,就能利用强大的世界模型直接理解物理逻辑并内化为控制策略。
Cortex 2.0 的出现预示着,未来的工业机器人将不再是呆板的指令执行器,而是能够“三思而后行”的智能体。
