[arXiv 2026] ΔVLA:世界知识的“变与不变”——开启高效具身智能新范式
$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
本文提出了 ΔVLA,一种基于先验引导的视觉-语言-动作(VLA)模型,通过建模相对于当前世界知识先验的“差异(Variation/Delta)”而非回归绝对未来状态来生成动作。该框架在 LIBERO (97.8%) 和 RoboTwin 2.0 (80.4%) 仿真基准上均取得了 SOTA 战绩,并在多项跨平台机器人实物任务中展现了极高的长程操作稳定性。
TL;DR
在机器人操作领域,传统的 Vision-Language-Action (VLA) 模型往往像个“预言家”,试图凭空预测未来的画面。而由 Yijie Zhu 等人提出的 ΔVLA 则打破了这种范式:它不再纠结于未来长什么样,而是专注于由于当前动作引起的世界知识变化(Variation)。通过构建明确的当前状态锚点与离散的变化特征,ΔVLA 在训练效率提升 2 倍的同时,刷写了多个仿真与实物任务的成功率记录。
背景定位:从“预言图像”到“感知差异”
当前的预测型 VLA 工作(如 CoT-VLA, DreamVLA)通常将未来图像或状态作为动作生成的中间推理步骤。然而,这种“绝对回归”范式存在天然的缺陷:
- 缺乏因果锚点:如果不明确知道“现在”在哪,模型很难确切感知“变化”的因果关系。
- 视觉冗余:环境中的背景、光效等大量信息与控制无关。
- 不稳定性:连续的变化值受场景影响波动巨大。
ΔVLA 的核心 Insight 极其深刻:动作的质量是由它引发的变化决定的,而不是由未来的绝对状态决定的。
核心方法论详解
1. PWKE:构建当下的“因果锚点”
为了让模型不乱猜,ΔVLA 首先通过 Prior-Guided World Knowledge Extractor (PWKE) 提取当前世界的关键知识。
- 双编码器融合:结合了 SigLIP(强语义)和 DINOv2(强空间几何)。
- 三要素提取:利用辅助头(Auxiliary Heads)在训练阶段监督模型提取可操作区域(Region)、深度(Depth)和语义特征(Semantic)。
- 注意力掩码:通过 Masked Attention 确保区域 Token 专注于原始视觉观察,过滤冗余信息。
图 1:ΔVLA 整体框架,展示了从 PWKE 提取先验到动作生成的全流程
2. LWVQ:将变化量“离散化”
受 Genie 的启发,作者设计了 Latent World Variation Quantization (LWVQ)。它不要求 LLM 预测复杂的图像,而是预测一组离散的序列。
- 这种 VQ-VAE 架构将连续的差值(ΔW)映射到学习好的 Codebook 中。
- 这种离散潜在表示为策略学习提供了一个极其稳定、结构化的接口。
3. CV-Atten:模态间的隔离墙
为了防止深度信息干扰语义判断,Conditional Variation Attention (CV-Atten) 机制粉墨登场。它通过结构化掩码,强制要求“深度的变化”只看“当下的深度先验”,实现了跨模态的去耦合推理。
实验战绩与效率飞跃
ΔVLA 在 LIBERO 基准测试中几乎达到了“通关”水准。
| Method | LIBERO Average SR | Training Cost (per 10k steps) | 推理频率 (Hz) |
|---|---|---|---|
| OpenVLA | 76.5% | 11.7 h | 3.9 Hz |
| DreamVLA | 92.6% | 14.5 h | 7.7 Hz |
| ΔVLA | 97.8% | 4.9 h | 76.2 Hz |
图 2:在 LIBERO 各种复杂任务下的 SOTA 成就
深度洞察:为什么它更快、更强?
- 效率:由于 PWKE 极大减少了视觉 Token 的采样(仅保留 64+9 个关键 Token),且 LWVQ 预测的是紧凑的离散码,计算压力直线下降。
- 鲁棒性:消融实验证明,即便在先验标签存在 30% 噪声的情况下,ΔVLA 的性能依然稳健,这对于依赖伪标签(Pseudo Labels)的机器人系统至关重要。
总结与未来展望
ΔVLA 的成功标志着 VLA 模型正在从“视觉生成”向“因果推理”转型。它不再追求画出一张漂亮的未来照片,而是追求精准识别动作引起的物理属性变化。
局限性:虽然系统对噪声有耐受度,但极度依赖于初始化伪标签的质量。如果感知模型(如 Depth-Anything v2)在特定光照下完全失效,系统的因果锚点可能会产生偏移。
启示:未来的具身基础模型可能会更多地采用这种“差分预测”范式,将世界模型真正作为控制的助推器,而非沉重的计算负担。
