VLA Foundry:打破孤岛,构建统一的具身智能训练基石

VLA Foundry: A Unified Framework for Training Vision-Language-Action Models

总结
问题
方法
结果
要点
摘要

本文推出了 VLA Foundry,这是一个由丰田研究院(TRI)开发的统一开源框架,支持大语言模型(LLM)、视觉语言模型(VLM)及视觉语言动作模型(VLA)的全流程训练。通过引入 Foundry-Qwen3VLA-2.1B 等系列模型,该框架在 LBM Eval 机器人基准测试中实现了显著的性能提升,其中基于 Qwen3-VL 的模型比之前的 SOTA 基线高出 20% 以上的成功率。

TL;DR

机器人基础模型(Robotics Foundation Models)的进化正在加速,但工具链的碎片化始终是研究者的痛点。丰田研究院(TRI)开源了 VLA Foundry,这是首个将 LLM(语言)、VLM(视觉语言)和 VLA(动作)训练完全打通的开源框架。它不仅支持从零预训练,还兼容 Hugging Face 上的 SOTA 权重,将机器人策略的训练从单纯的“下游微调”提升到了“全生命周期优化”的高度。

背景定位:从“缝合怪”走向“大一统”

在过去,训练一个 VLA 模型往往像是在玩“拼图”:从 A 处借一个 LLM,在 B 处找一个视觉编码器,然后在 C 处用机器人数据做微调。这种碎片化的方法(Stepwise training)隐藏了一个严重问题——预训练阶段的决策(如数据配比、Tokenizer 选择)会不可逆地影响机器人在物理世界中的表现。

VLA Foundry 的出现,标志着机器人研究正从“算法驱动”向“基础设施驱动”转型。它不再只是一个模型,而是一个能够通过单一行命令或 YAML 配置文件,就能控制从 1T Token 语料预训练到复杂双臂操作 fine-tuning 的工业级生产线。

痛点深挖:为什么我们需要全栈受控?

  1. 数据极速衰减:语言数据以 Trillion 计,而高质量机器人交互数据却极度匮乏。VLA Foundry 允许研究者进行多模态概率混合(Probabilistic mixing),让模型在学习“抓取”的同时不丢失“推理”能力。
  2. 工程瓶颈:大规模分布式训练(如 FSDP2)在机器人领域一直难以普及。VLA Foundry 封装了高效的并行技术,支持在 128 个 H100 GPU 上顺畅运行。
  3. 盲目对齐:许多框架将 VLM 视为黑盒,而 VLA Foundry 证明了,仅仅更换一个更强的网络主干(如从 1.7B 升级到 Qwen3-VL 主干),就能直接带来 20% 以上的成功率提升。

核心方法论:VLA Foundry 架构解析

VLA Foundry 的核心在于其模块化与可组合性(Modularity & Composability)

1. 统一的训练管道

框架设计了一个模型无关(Model-agnostic)的训练循环。无论是在训练 LLM 理解语法,还是在让 VLA 学习 Flow-matching 动作,底层的批处理(Batching)和损失构建逻辑都是一致的。

VLA Foundry 流程概览 图 1:VLA Foundry 架构总览。展示了从 LLM 到 VLM 再到 VLA 的三个阶段及其数据/权重的继承关系。

2. 精密的机器人数据处理

机器人动作的归一化(Normalization)是决定策略稳定性的关键。VLA Foundry 引入了 RoboticsNormalizer,支持基于百分位数(Percentile)和 T-digest 的合并统计,有效解决了多数据集训练中的离群值问题。

3. 先进的动作头(Action Head)

论文采用了 Flow Transformer 作为动作生成器。不同于传统的扩散模型(Diffusion Policy),Flow-matching 在推理速度和采样质量上展现了更好的平衡。

Foundry-VLA-1.7B 架构图 图 2:具体模型架构。图像通过 ViT 编码后,联同任务指令和观察 Token 输入 LLM,最后由 Flow Transformer 预测动作轨迹。

实验与战绩:Qwen3-VL 的降维打击

研究团队通过 VLA Foundry 训练并对比了多个模型。最引人注目的是 Foundry-Qwen3VLA-2.1B-MT

  • SOTA 性能:在 LBM Eval 这一极具挑战性的双臂协调操作基准测试中,该模型在 16 个任务上大幅超越了之前的基线(LBM)。
  • 跨域迁移:实验发现,在模拟环境下进行多任务预训练,然后再针对特定任务进行微调(Fine-tuning),能够获得最优的成功率平衡。

评估结果对比图 图 3:性能对比。图中清晰显示,基于 Qwen3 的模型(最右)性能远超传统的 LBM-MT 和从零训练的 1.7B 模型。

深度洞察:机器人研究的未来在“主干”

VLA Foundry 给行业带来的最大启发是:VLA 的上限实际上是由其 VLM 背景(Backbone)决定的。

虽然团队展示了从零训练 LLM 到 VLA 的全过程,但在实际应用中,利用如 Qwen3-VL 这种经过海量互联网数据洗礼的预训练模型作为起点,能让机器人策略具备更强的泛化能力。框架的开源不仅提供了模型,更重要是提供了一套“可重复性(Reproducibility)”的科学评价体系——通过集成的 STEP 工具进行贝叶斯统计分析,研究者可以准确判断一个策略的提升到底是真实存在的,还是随机扰动。

总结与致敬

VLA Foundry 的开源不仅是丰田研究院对社区的回馈,更是对具身智能研究规范的一次重塑。它告诉我们,机器人策略不应是孤立的黑盒算法,而应是通用 AI 拼图中最具动感的一块。

项目地址: https://github.com/TRI-ML/vla_foundry


注:本文基于 VLA Foundry 技术报告重构。文中保留了 FSDP2, SOTA, WebDataset, Flow-matching 等技术术语以确保专业性。

发现相似论文

试试这些示例

  • 查找最近其他试图通过统一 LLM 和 VLA 训练管道来解决机器人数据效率问题的 SOTA 框架或论文。
  • 哪篇论文最早提出了 Flow-matching 及其在机器人动作预测(Action Head)中的应用,本文又是如何将其与 Transformer 架构集成的?
  • 有哪些研究探讨了 VLM 预训练数据的配比(如图像描述数据与纯文本数据比例)对下游机器人操纵任务成功率的具体影响?
目录
VLA Foundry:打破孤岛,构建统一的具身智能训练基石
1. TL;DR
2. 背景定位:从“缝合怪”走向“大一统”
3. 痛点深挖:为什么我们需要全栈受控?
4. 核心方法论:VLA Foundry 架构解析
4.1. 1. 统一的训练管道
4.2. 2. 精密的机器人数据处理
4.3. 3. 先进的动作头(Action Head)
5. 实验与战绩:Qwen3-VL 的降维打击
6. 深度洞察:机器人研究的未来在“主干”
7. 总结与致敬