[arXiv 2026] ΔVLA:世界知识的“变与不变”——开启高效具身智能新范式

$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation

总结
问题
方法
结果
要点
摘要

本文提出了 ΔVLA,一种基于先验引导的视觉-语言-动作(VLA)模型,通过建模相对于当前世界知识先验的“差异(Variation/Delta)”而非回归绝对未来状态来生成动作。该框架在 LIBERO (97.8%) 和 RoboTwin 2.0 (80.4%) 仿真基准上均取得了 SOTA 战绩,并在多项跨平台机器人实物任务中展现了极高的长程操作稳定性。

TL;DR

在机器人操作领域,传统的 Vision-Language-Action (VLA) 模型往往像个“预言家”,试图凭空预测未来的画面。而由 Yijie Zhu 等人提出的 ΔVLA 则打破了这种范式:它不再纠结于未来长什么样,而是专注于由于当前动作引起的世界知识变化(Variation)。通过构建明确的当前状态锚点与离散的变化特征,ΔVLA 在训练效率提升 2 倍的同时,刷写了多个仿真与实物任务的成功率记录。

背景定位:从“预言图像”到“感知差异”

当前的预测型 VLA 工作(如 CoT-VLA, DreamVLA)通常将未来图像或状态作为动作生成的中间推理步骤。然而,这种“绝对回归”范式存在天然的缺陷:

  • 缺乏因果锚点:如果不明确知道“现在”在哪,模型很难确切感知“变化”的因果关系。
  • 视觉冗余:环境中的背景、光效等大量信息与控制无关。
  • 不稳定性:连续的变化值受场景影响波动巨大。

ΔVLA 的核心 Insight 极其深刻:动作的质量是由它引发的变化决定的,而不是由未来的绝对状态决定的。

核心方法论详解

1. PWKE:构建当下的“因果锚点”

为了让模型不乱猜,ΔVLA 首先通过 Prior-Guided World Knowledge Extractor (PWKE) 提取当前世界的关键知识。

  • 双编码器融合:结合了 SigLIP(强语义)和 DINOv2(强空间几何)。
  • 三要素提取:利用辅助头(Auxiliary Heads)在训练阶段监督模型提取可操作区域(Region)深度(Depth)语义特征(Semantic)
  • 注意力掩码:通过 Masked Attention 确保区域 Token 专注于原始视觉观察,过滤冗余信息。

模型架构图 图 1:ΔVLA 整体框架,展示了从 PWKE 提取先验到动作生成的全流程

2. LWVQ:将变化量“离散化”

受 Genie 的启发,作者设计了 Latent World Variation Quantization (LWVQ)。它不要求 LLM 预测复杂的图像,而是预测一组离散的序列。

  • 这种 VQ-VAE 架构将连续的差值(ΔW)映射到学习好的 Codebook 中。
  • 这种离散潜在表示为策略学习提供了一个极其稳定、结构化的接口。

3. CV-Atten:模态间的隔离墙

为了防止深度信息干扰语义判断,Conditional Variation Attention (CV-Atten) 机制粉墨登场。它通过结构化掩码,强制要求“深度的变化”只看“当下的深度先验”,实现了跨模态的去耦合推理。

实验战绩与效率飞跃

ΔVLA 在 LIBERO 基准测试中几乎达到了“通关”水准。

MethodLIBERO Average SRTraining Cost (per 10k steps)推理频率 (Hz)
OpenVLA76.5%11.7 h3.9 Hz
DreamVLA92.6%14.5 h7.7 Hz
ΔVLA97.8%4.9 h76.2 Hz

实验结果对比 图 2:在 LIBERO 各种复杂任务下的 SOTA 成就

深度洞察:为什么它更快、更强?

  • 效率:由于 PWKE 极大减少了视觉 Token 的采样(仅保留 64+9 个关键 Token),且 LWVQ 预测的是紧凑的离散码,计算压力直线下降。
  • 鲁棒性:消融实验证明,即便在先验标签存在 30% 噪声的情况下,ΔVLA 的性能依然稳健,这对于依赖伪标签(Pseudo Labels)的机器人系统至关重要。

总结与未来展望

ΔVLA 的成功标志着 VLA 模型正在从“视觉生成”向“因果推理”转型。它不再追求画出一张漂亮的未来照片,而是追求精准识别动作引起的物理属性变化。

局限性:虽然系统对噪声有耐受度,但极度依赖于初始化伪标签的质量。如果感知模型(如 Depth-Anything v2)在特定光照下完全失效,系统的因果锚点可能会产生偏移。

启示:未来的具身基础模型可能会更多地采用这种“差分预测”范式,将世界模型真正作为控制的助推器,而非沉重的计算负担。

发现相似论文

试试这些示例

  • 查找最近一年(2025-2026)中基于预测世界模型(World Models)改进机器人操作成功率的相关论文。
  • 哪篇论文最早在 VLA 领域引入了离散化的潜在变化表示(Latent Variation),本文的 LWVQ 与其有何异同点?
  • 探索将 ΔVLA 中的变分建模(Difference Modeling)思想应用到自动驾驶或无人机导航任务中的可行性研究。
目录
[arXiv 2026] ΔVLA:世界知识的“变与不变”——开启高效具身智能新范式
1. TL;DR
2. 背景定位:从“预言图像”到“感知差异”
3. 核心方法论详解
3.1. 1. PWKE:构建当下的“因果锚点”
3.2. 2. LWVQ:将变化量“离散化”
3.3. 3. CV-Atten:模态间的隔离墙
4. 实验战绩与效率飞跃
4.1. 深度洞察:为什么它更快、更强?
5. 总结与未来展望