[CVPR 2026] LLaVA-VLA:0.5B 小模型如何逆袭 7B 大模型,开启移动操控新范式?
Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
本文提出了 LLaVA-VLA,这是一个轻量级(0.5B参数)且无需大规模机器人数据预训练的视觉-语言-动作模型。通过引入自有的 CEBench 基准测试集,该模型在单臂、双臂及移动操作任务中达到了 SOTA 性能,尤其在 CALVIN 基准上以极小的参数量超越了 7B 规模的 OpenVLA。
TL;DR
在具身智能(Embodied AI)领域,Vision-Language-Action (VLA) 模型一直被认为是“大参数量”和“巨额预训练”的代名词。然而,来自浙江大学等机构的研究团队推出的 LLaVA-VLA 彻底打破了这一迷思。仅凭 0.5B 的参数量和无需大规模预训练的特质,它在 CALVIN 等权威榜单上超越了 7B 的 OpenVLA,并且成为了首个能真正处理“边走边抓”(移动操作)的端到端 VLA 模型。
痛点深挖:昂贵且笨重的“工业巨人”
目前的 VLA 研究正陷入一种“堆料”怪圈:
- 部署难:主流模型动辄 7B、10B 参数,这让只有消费级显卡(如 RTX 409B)或移动机器人算力板的研究者望而却步。
- 数据渴:动用数以亿计的互联网视频或机器人轨迹进行预训练,资源消耗极大。
- 能力偏科:大多数模型只能守着桌子转(固定基座操作),一旦要求机器人“走到客厅把茶杯拿过来”,模型往往因为导航与动作空间的割裂而崩溃。
核心洞察:LLaVA-VLA 的“轻量化”哲学
作者通过一系列控制变量实验,提炼出了 8 个关键发现(Findings),重塑了我们对 VLA 的认知。
1. 架构设计的“物理直觉”
LLaVA-VLA 并未盲目追求复杂,而是回归了最有效的感知逻辑:
- 多视角融合(Multi-view):将第三人称全局图与第一人称手眼图直接纵向拼接。这种做法对比传统的 Token 序列拼接,既减少了 Token 冗余,又保留了深度感知所需的立体信息。
- 本体感知 Token 化(Proprioception Tokenization):不同于常规的 MLP 线性映射,作者将机器人的关节状态(Proprioception)也转化为 Token,让 LLM 像理解文本一样理解自己的肢体位置。
图 1:LLaVA-VLA 整体架构,展示了图像拼接输入与动作分块输出流程
2. 动作空间的“大一统”
为了解决移动操作问题,作者设计了一个混合动作空间。模型不再只输出机械臂的 7DoF 坐标,而是通过特殊的 Direction Token(前进、左转、停止)+ Value Token(距离、角度)来实现。
- 巧妙之处:当方向为“停止”时,紧接其后的 Token 自动切换为精细操作参数。这种设计让模型能像人类一样:先导航至目标点,再切换至操作模式。
实验战绩:极致的鲁棒性
在仿真环境 CEBench 和真实机器人实验中,LLaVA-VLA 展现出了惊人的泛化能力。
- CALVIN 榜单逆袭:在未见过的场景(ABC→D 设置)下,LLaVA-VLA 0.5B 跑出了 3.68 的平均步数,而 OpenVLA 7B 仅为 3.27。这意味着参数减小了 14 倍,效率反而更高。
- 抗干扰能力:在真实世界中加入随机遮挡、改变光照或放置随机干扰物(如笔、方块),传统的 ACT 模型成功率几乎掉到零,而 LLaVA-VLA 依然能维持约 30% 的高成功率。
表 1:在 RoboTwin 仿真中的性能对比,LLaVA-VLA 在 DR(领域随机化)环境下具有明显优势
深度洞察:为什么它有效?
- Action Chunking 的魔力:通过一次性预测未来 5 步的动作,LLaVA-VLA 获得了某种“预判”能力,解决了端到端控制中常见的抖动问题,使动作更为平滑(Temporal Coherence)。
- 抛弃预训练的勇气:实验证明,对于特定领域的下游任务,高质量的“两阶段训练”(后训练+微调)比大规模跨域预训练更有效。这为算力有限的实验室指明了方向。
总结与局限
LLaVA-VLA 的出现是具身智能领域的一次“民主化”尝试。它告诉我们,通过合理的表征设计,消费级 GPU 也能跑出顶尖的机器人 Agent。
局限性:尽管导航与操作实现了统一,但在“边走边抓”的高动态同步任务中(例如抓取移动物体),该模型仍有提升空间。此外,对于长程逻辑推理(如“先去厨房洗碗,如果洗洁精没了就去储藏室拿”),还需要更强的认知骨架支持。
未来展望:随着基础视觉模型(Vision Backbone)的持续进化,结合 LLaVA-VLA 这种轻量化动作架构,真正的家居移动助手可能比我们预想的更早到来。
