[ICRA 2025/2026] FAVLA:力自适应快慢 VLA 模型,突破接触密集型机器人操作瓶颈
FAVLA: A Force-Adaptive Fast-Slow VLA model for Contact-Rich Robotic Manipulation
本文提出了 FAVLA,一种针对接触密集型机器人操作的力自适应快慢 VLA 模型。该方法通过解耦低频语义感知(VLM)与高频触觉动作控制(AE),利用预测的未来力变化动态调整推理频率,在多个高精度任务中达到了 SOTA 性能。
TL;DR
在机器人操作中,视觉决定“去哪里”,而力觉决定“怎么插”。本文提出的 FAVLA 是一种全新的 Vision-Language-Action (VLA) 架构。它通过将复杂的语义理解(慢系统)与灵敏的触觉反馈(快系统)解耦,并引入力自适应推理策略,成功解决了高精度组装任务中常见的反应迟钝和力突变问题。
背景定位
当前的 VLA 模型(如 OpenVLA, π0)在移动物体等语义任务上表现出色,但在涉及毫米级精度的工业操作(如齿轮咬合、USB 插入)时频频翻车。核心原因在于:物理接触是瞬态的。如果你以 10-15Hz 的采样率去处理 1000Hz 的力信号,当机器人感觉到“撞墙”时,由于动作块(Action Chunk)的开环执行,它早已经把零件顶坏了。
核心动机:为什么要分“快慢”?
作者观察到,人类操作物体时并非全程紧绷神经:
- 慢速语义规划(Slow):识别环境、对准目标,这部分信息变化慢,不需要极高频率。
- 快速闭环补偿(Fast):当零件接触的一刹那,肌肉会根据力觉反馈产生毫秒级的微调,这是纯视觉无法替代的。
FAVLA 的直觉是:不要强行把高频力信号降采样到视觉频率,而是让模型根据预测的交互剧烈程度,动态决定“反应有多快”。
架构详解:Force-Injected Fast–Slow VLA
FAVLA 将模型拆分为两个互补的部分:
- Slow VLM Backbone:基于 PaliGemma 的大型后端,整合图像、语言指令和长周期力历史。它生成一个上下文缓存(KV Cache),并预测未来的力方差(Force Variance)。
- Fast Action Expert (AE):一个轻量化的 Transformer。它复用 VLM 的缓存,但每一步都通过 Force Adapter 注入实时力信号 。

关键创新:力自适应推理
这是本文最精妙的设计。VLM 会输出一个预测值 (未来力波动的剧烈程度)。
- 自由空间运动:此时预测力方差小,AE 保持低频运行,节省算力。
- 接触/插入瞬间:预测方差激增,系统自动将 AE 的运行频率推向最高(),实现高频闭环纠错。

实验战绩:高精度与轻柔操作
在 USB 插入、齿轮组装、翻转纸箱和擦白板等任务中,FAVLA 表现惊人:
- 成功率:在齿轮组装任务中达到了 93.3% 的成功率。
- 力控精度:相比 π0 基线,FAVLA 对力的控制更加“轻柔”。在齿轮组装中,峰值力从 12.0N 显著下降到 7.7N,有效避免了工业场景中的部件磨损或安全自停。

消融实验揭示:
- 单纯加力信号不够:如果只是把力数据拼成 Token 给 VLM,由于 Token 数量远少于图像,力信号会被“淹没”。
- 力适配器(Force Adapter)是核心:在 AE 的多层中反复注入力反馈,才能迫使模型在生成动作轨迹时,“听从”触觉的指挥。
深度洞察
FAVLA 的成功揭示了 VLA 领域的一个重要趋势:回归控制本质。在大模型语义横行的当下,本文通过快慢系统的引入,重新拾起了控制理论中对采样间隔和状态反馈的尊重。
局限性分析: 目前的力方差预测仍然依赖于离线数据预标注。在完全未见的极端场景下,如果 VLM 未能预测到即将发生的撞击,系统可能无法及时切换到高频模式。此外,如何将这种异步频率机制扩展到多臂协同(Bimanual)且负载极度不平衡的任务,仍值得探索。
总结
FAVLA 通过“力度预测引导的动态频率调整”,为机器人穿针引线般的精细操作找到了新路径。它不仅让 VLA 更有“脑子”,更让它有了灵敏的“手感”。
