AnyCamVLA: 视角不再是阻碍,让 VLA 机器人具备“虚拟走位”能力

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

总结
问题
方法
结果
要点
摘要

本文提出了 AnyCamVLA,一种针对视觉-语言-动作模型 (VLA) 的 Zero-shot 相机自适应框架。通过引入实时的前向视角合成模型 (LVSM),该方法能将任意测试环境下的图像虚拟调整回训练时的相机视角,从而在无需微调策略或额外演示数据的情况下,显著提升机器人操作的视角稳健性。

TL;DR

在机器人领域,视角变化(Viewpoint Variation)一直是预训练策略的“杀手”。本文介绍的 AnyCamVLA 另辟蹊径:与其费力微调庞大的 VLA 模型,不如在模型前端加一个“眼镜”。它利用最新的前向视角合成技术,将乱动甚至手持的相机画面实时纠正回模型熟悉的训练视角。该方法实现了 Zero-shot 适配,成功率提升巨大,且无需改动原模型一行代码。

痛点深挖:为何 VLA 模型这么“脆”?

Vision-Language-Action (VLA) 模型虽然在语义理解上很强,但在几何空间感上极其脆弱。

  1. 高度过拟合:预训练 VLA 在少量任务数据上微调后,会对相机的外参(位置、角度)和内参(焦距)形成强依赖。
  2. 微调成本高:为了让 7B 规模的模型适应新视角,通常需要成千上万条新的演示轨迹。
  3. 灾难性遗忘:一旦为了适应新视角而微调,模型在原始视角下的表现往往会大幅下滑。

视角偏移对比图 图 1:AnyCamVLA 框架支持多种相机(iPhone, ZED)实时适配到训练视角。

核心逻辑:从“模型适配”转向“观测适配”

作者提出,既然改变模型很难,那就在推理时动态地改变图像。

1. 虚拟相机调整 (Virtual Adjustment)

AnyCamVLA 引入了一个 LVSM (Large View Synthesis Model) 作为视觉适配层。给定测试时的图像 和相机参数 ,再给定训练时的期望参数 ,它能瞬间生成一张看起来像是从 拍摄的合成图像

2. 前向推理的优势

不同于 NeRF 需要耗时几分钟的逐场景优化,LVSM 是 Feed-forward 的。这意味着它能在几毫秒内完成处理。

  • 速度:30 FPS (约 36ms 延迟)。
  • 通用性:不改变输入模态,VLA 依然接收它最擅长的 RGB 图像,完全保留了互联网规模预训练的语义先验。

实验分析:全方位的霸榜

在 LIBERO 仿真任务中,当视角发生“Large”级别的剧烈扰动时,传统的 VLA 基准(如 OpenVLA, )成功率直接从 90% 以上跌破 40%。

模型表现对比表 表 1:AnyCamVLA 在各项测试中均保持了极高的稳健性。

为什么比微调更好?

作者通过消融实验展示了一个扎心的事实:微调 1 个新视角会毁掉之前学到的 9 个视角。如图所示,随着微调步数增加,模型对原始视角的处理能力(Catastrophic Forgetting)会显著下降。而 AnyCamVLA 因为冻结了策略网络,完全没有这个顾虑。

遗忘曲线 图 2:微调策略(橙线)在获得新能力的同时,原始能力的崩塌速度令人警醒。

真实世界验证:手持 Phone 也能操控?

最惊艳的部分在于真实实验。作者不仅测试了固定位置的偏移,还尝试了用手拿着 iPhone 在机器人旁边乱晃。由于 AnyCamVLA 能实时计算 ArUco 标记的姿态并进行视角校正,底层的机器人策略完全感觉不到相机的晃动,依然能精准完成“拿柠檬进碗”等精细动作。

真实世界设置 图 3:实验环境,通过视觉校正实现动态相机的实时适配。

深度思考与结论

AnyCamVLA 的成功本质上是将物理空间的几何一致性任务决策的语义一致性中解耦了出来。

优点

  • 部署极快:新相机往桌上一放,标定一下位姿,立刻就能用。
  • 计算友好:LVSM 参数仅 171M,远小于 VLA,对 GPU 的额外负担可控。

局限性

  • 视线遮挡:如果测试视角看不到训练视角必须的关键部位(如被物体遮挡),合成质量会下降。
  • 依赖标定:目前仍需要已知的相机位姿(Extrinsics),未来如能结合自动中心化技术则更完美。

总结:AnyCamVLA 为 VLA 的实用化提供了一条非常务实的路径。它告诉我们:解决泛化问题,有时不需要更大的模型,只需要一个更聪明的“取景器”。

发现相似论文

试试这些示例

  • 查找最近其他利用视觉合成(Novel View Synthesis)来增强具身智能机器人策略泛化性的论文。
  • LVSM (Large View Synthesis Model) 的核心架构是什么,它与传统的 NeRF 或 3D Gaussian Splatting 在实时性上有何本质区别?
  • 有哪些研究探讨了 VLA 模型在微调过程中发生灾难性遗忘 (Catastrophic Forgetting) 的量化评估与缓解策略?
目录
AnyCamVLA: 视角不再是阻碍,让 VLA 机器人具备“虚拟走位”能力
1. TL;DR
2. 痛点深挖:为何 VLA 模型这么“脆”?
3. 核心逻辑:从“模型适配”转向“观测适配”
3.1. 1. 虚拟相机调整 (Virtual Adjustment)
3.2. 2. 前向推理的优势
4. 实验分析:全方位的霸榜
4.1. 为什么比微调更好?
5. 真实世界验证:手持 Phone 也能操控?
6. 深度思考与结论