[ICRA 2025/2026] FAVLA:力自适应快慢 VLA 模型,突破接触密集型机器人操作瓶颈

FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation

总结
问题
方法
结果
要点
摘要

本文提出了 FAVLA,一种针对接触密集型机器人操作的力自适应快慢 VLA 模型。该方法通过解耦低频语义感知(VLM)与高频触觉动作控制(AE),利用预测的未来力变化动态调整推理频率,在多个高精度任务中达到了 SOTA 性能。

TL;DR

在机器人操作中,视觉决定“去哪里”,而力觉决定“怎么插”。本文提出的 FAVLA 是一种全新的 Vision-Language-Action (VLA) 架构。它通过将复杂的语义理解(慢系统)与灵敏的触觉反馈(快系统)解耦,并引入力自适应推理策略,成功解决了高精度组装任务中常见的反应迟钝和力突变问题。

背景定位

当前的 VLA 模型(如 OpenVLA, π0)在移动物体等语义任务上表现出色,但在涉及毫米级精度的工业操作(如齿轮咬合、USB 插入)时频频翻车。核心原因在于:物理接触是瞬态的。如果你以 10-15Hz 的采样率去处理 1000Hz 的力信号,当机器人感觉到“撞墙”时,由于动作块(Action Chunk)的开环执行,它早已经把零件顶坏了。

核心动机:为什么要分“快慢”?

作者观察到,人类操作物体时并非全程紧绷神经:

  1. 慢速语义规划(Slow):识别环境、对准目标,这部分信息变化慢,不需要极高频率。
  2. 快速闭环补偿(Fast):当零件接触的一刹那,肌肉会根据力觉反馈产生毫秒级的微调,这是纯视觉无法替代的。

FAVLA 的直觉是:不要强行把高频力信号降采样到视觉频率,而是让模型根据预测的交互剧烈程度,动态决定“反应有多快”。

架构详解:Force-Injected Fast–Slow VLA

FAVLA 将模型拆分为两个互补的部分:

  1. Slow VLM Backbone:基于 PaliGemma 的大型后端,整合图像、语言指令和长周期力历史。它生成一个上下文缓存(KV Cache),并预测未来的力方差(Force Variance)
  2. Fast Action Expert (AE):一个轻量化的 Transformer。它复用 VLM 的缓存,但每一步都通过 Force Adapter 注入实时力信号

FAVLA 模型架构图

关键创新:力自适应推理

这是本文最精妙的设计。VLM 会输出一个预测值 (未来力波动的剧烈程度)。

  • 自由空间运动:此时预测力方差小,AE 保持低频运行,节省算力。
  • 接触/插入瞬间:预测方差激增,系统自动将 AE 的运行频率推向最高(),实现高频闭环纠错。

推理策略与时间系综

实验战绩:高精度与轻柔操作

USB 插入齿轮组装翻转纸箱擦白板等任务中,FAVLA 表现惊人:

  • 成功率:在齿轮组装任务中达到了 93.3% 的成功率。
  • 力控精度:相比 π0 基线,FAVLA 对力的控制更加“轻柔”。在齿轮组装中,峰值力从 12.0N 显著下降到 7.7N,有效避免了工业场景中的部件磨损或安全自停。

任务场景展示

消融实验揭示:

  • 单纯加力信号不够:如果只是把力数据拼成 Token 给 VLM,由于 Token 数量远少于图像,力信号会被“淹没”。
  • 力适配器(Force Adapter)是核心:在 AE 的多层中反复注入力反馈,才能迫使模型在生成动作轨迹时,“听从”触觉的指挥。

深度洞察

FAVLA 的成功揭示了 VLA 领域的一个重要趋势:回归控制本质。在大模型语义横行的当下,本文通过快慢系统的引入,重新拾起了控制理论中对采样间隔和状态反馈的尊重。

局限性分析: 目前的力方差预测仍然依赖于离线数据预标注。在完全未见的极端场景下,如果 VLM 未能预测到即将发生的撞击,系统可能无法及时切换到高频模式。此外,如何将这种异步频率机制扩展到多臂协同(Bimanual)且负载极度不平衡的任务,仍值得探索。

总结

FAVLA 通过“力度预测引导的动态频率调整”,为机器人穿针引线般的精细操作找到了新路径。它不仅让 VLA 更有“脑子”,更让它有了灵敏的“手感”。

发现相似论文

试试这些示例

  • 查找最近其他试图解决 Transformer 类机器人模型中多传感器采样率不匹配(Mismatched Sampling Rates)问题的论文。
  • 哪篇论文最早在机器人策略中提出了快慢双系统(Fast-Slow System)架构,本文与之在感知逻辑上有何不同?
  • 有哪些研究将类似 FAVLA 的力自适应机制应用到了双臂协同操作或多模态触觉皮肤任务中?
目录
[ICRA 2025/2026] FAVLA:力自适应快慢 VLA 模型,突破接触密集型机器人操作瓶颈
1. TL;DR
2. 背景定位
3. 核心动机:为什么要分“快慢”?
4. 架构详解:Force-Injected Fast–Slow VLA
4.1. 关键创新:力自适应推理
5. 实验战绩:高精度与轻柔操作
5.1. 消融实验揭示:
6. 深度洞察
7. 总结