[CVPR 2026] Mean-Flow VLA:打破生成式架构延迟,“一步到位”实现 84 倍速机器人控制
Mean-Flow based One-Step Vision-Language-Action
本文提出了 Mean-Flow based One-Step VLA,这是一种基于 MeanFlow 生成式框架的新型视觉-语言-动作模型。通过将传统的迭代式 FlowMatching 机制重构为均值去噪向量场预测,该方法首次在 VLA 领域实现了高质量的单步(One-shot)动作序列生成。
TL;DR
在机器人具身智能(Embodied AI)领域,Vision-Language-Action (VLA) 模型正面临一个“不可能三角”:高质量动作、低模型延迟、以及简单的训练流程。传统的 Diffusion Policy 虽然效果好但推理极慢,而 FlowMatching 模型在步数减少时精度崩塌。
本文提出的 Mean-Flow based One-Step VLA 彻底打破了这一僵局。通过引入 MeanFlow(均值流) 技术,该模型实现了在 NFE=1(单步推理) 下生成高质量连续动作块,速度相比 SmolVLA 提升了 8.7 倍,相比传统的 Diffusion Policy 更是狂飙 83.9 倍。
痛点深挖:为什么“快”与“准”不可兼得?
目前的生成式 VLA 主要分为两派:
- Diffusion-based: 如 Octo,依靠反复迭代去噪。虽然连续性好,但 NFE(函数调用次数)通常需要 20-50 次,实时反馈极差。
- FlowMatching-based: 如 π0,试图通过 ODE 轨迹简化生成。虽然比扩散模型快,但当 NFE 降低到 1-3 次时,欧拉积分的累计误差会让生成的动作轨迹发生剧烈偏离,就像在高速过弯时强行直线行驶。
核心动机: 能否让模型不再学习“每一个细微的瞬时变化”,而是直接学习“从 A 点到 B 点的最优平均路径”?
核心方法:从瞬时到均值的升维思考
作者引入了由 Kaiming He 等人近期提出的 MeanFlow 理论。其物理直觉非常精妙:
1. MeanFlow 恒等式 (MeanFlow Identity)
传统的 FlowMatching 拟合的是瞬时速度场 。而 MeanFlow 学习的是均值向量场 ,定义为: 这意味着模型在训练阶段就已经内置了“积分”的过程。在推理阶段,原本需要多步累加的积分过程,现在可以通过模型的一次 Forward 直接给出预测。
2. 模型架构
系统采用 pre-trained VLM (SmolVLM-2) 作为视觉-语义特征提取器,后端连接一个基于 Transformer 的 Mean-Flow Action Expert。
图 1:Mean-Flow VLA 整体架构,VLM 负责理解环境,Mean-Flow Expert 负责一步生成动作序列。
3. 三大关键设计
- Flow Ratio (0.2):作者发现 100% 学习均值流会导致训练不稳定。通过保留 20% 的瞬时流(Instantaneous Field)样本作为“局部锚点”,能显著提升训练收敛速度。
- Adaptive Loss ():传统 L2 Loss 对机器人多模态数据的离群点(Outliers)太敏感。采用自适应损失函数能有效抑制高方差样本的干扰。
- Action Chunking (n=20):在单步生成下,20 个时步的动作块长度在“响应灵敏度”与“轨迹平滑度”之间达到了完美平衡。
实验与结果:速度与成效的降维打击
作者在 pick-place(抓取投放)、stacking(堆叠)、sorting(长程分类)三个真实任务上进行了验证。
图 2:真实环境下的 SO-101 机械臂实验任务。
关键战绩对比:
- 推理延迟:One-Step VLA 实现了一次前向传播即出结果,其生成速度是 Diffusion Policy 的 83.9 倍。
- 成功率:在 NFE=1 时,PickPlace 任务成功率达到 88%,基本追平了需要多次迭代的步进模型。
- 消融实验:实验证明,当 NFE 从 1 增加到 5 时,性能会有进一步提升(从 49% 到 84.5%),这为精度要求极高的任务(如 Stacking)提供了灵活的调整空间。
表 1:多任务下的成功率对比。可以看到,在 PickPlace 任务中,其表现甚至超越了 SmolVLA 基线。
深度洞察:为什么这很重要?
以往的 VLA 研究往往沉迷于扩大参数量(如 RT-2),但 Mean-Flow 告诉我们,算法层面的“数学直觉” 能够大幅降低推理成本。
- Inductive Bias 的胜利:通过在损失函数中显式包含 Jacobian-vector product (JVP),模型被赋予了更强的时序物理约束。
- 单机部署的可能性:这种 8.7 倍的提速意味着,未来的高性能 VLA 不再需要昂贵的显卡集群进行推理,在消费级硬件甚至嵌入式机器人平台上实现实时流式控制已不再遥远。
总结与局限性
虽然 Mean-Flow VLA 在速度上近乎完美,但在涉及极高精度(如 Stacking 任务中,其成功率 64% 略逊于 SmolVLA 的 81.5%)时,单步预测仍然面临挑战。这说明对于高非线性、高精度要求的运动轨迹,多步细化(Multi-step Refinement)依然有其存在价值。
未来方向:如何结合强化学习(RL)来进一步微调 Mean-Flow 预测的轨迹,使其在保持超高速度的同时,具备更强的抗干扰能力和长程规划精度?这将是极具研究价值的方向。
