[Force Policy] 突破接触操作瓶颈:像人类一样感知视觉与力的平衡

ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding

总结
问题
方法
结果
要点

本文提出了 Force Policy,一种受人类感官分工启发的全局-局部视觉-力觉协作策略。该方法通过从演示中提取物理意义明确的“交互坐标系 (Interaction Frame, IF)”,实现了在复杂接触任务中将视觉引导的运动与高频力反馈控制解耦,达到了领域领先的 SOTA 性能。

TL;DR

在机器人挑战接触密集型任务(如插拔充电头、撕除顽固标签)时,传统端到端策略往往在“泛化能力”和“力控精度”之间顾此失彼。上海交大与 Flexiv 团队联合推出的 Force Policy 提出了一个巧妙的解方案:仿照人类的分工,让视觉(低频)管“去哪里”,让力觉(高频)管“怎么摸”。通过引入显式的物理 Interaction Frame (IF),该方法在保持强大泛化性的同时,实现了极其稳定的力位混合控制。


1. 痛点:为什么端到端力觉策略总是不够稳?

在工业级或家庭场景中,接触密集型操作 (Contact-rich Manipulation) 极难。

  • 模态冲突:力信号充满噪声。如果直接拼接到 Vision Transformer 中,这些高频抖动往往会带偏长程视觉规划。
  • 逻辑耦合:现有的 SOTA 方法(如 RDP)往往让快慢策略强耦合,一旦视觉端预测稍有偏差,快速反馈环节就会因为超出分布 (OOD) 而产生灾难性抖动。
  • 结构缺失:机器人不知道自己在“摸什么”。如果没有一个物理坐标系,机器人很难区分什么是“摩擦力”,什么是“几何约束”。

2. 核心技术:回归物理本质的 Interaction Frame (IF)

本文最深刻的 Insight 在于对 Interaction Frame (IF) 的重新定义。作者不再依赖已知的 CAD 模型,而是从能量消耗的角度出发:

  • 耗散残差 (Dissipative Residual):源于摩擦或粘性损耗。
  • 结构残差 (Structural Residual):源于环境刚度。

通过 Gemini 3 Pro 识别任务阶段,模型能自适应地从演示数据中恢复出当前的交互轴。例如,在撕标签任务中, 轴对齐法向量,而 轴自动对齐运动方向。

模型架构图 图 1:Force Policy 架构 - 全局视觉指导与局部力反馈执行的二重奏


3. 架构解析:双速率异步调度器 (Dual-Policy Scheduler)

Force Policy 由两部分组成:

  1. Π_global (低频视觉策略):基于 RISE-2,利用 3D 点云提供全局语义和几何特征
  2. Π_local (高频力策略):这是一个 50Hz 的快速循环。它根据全局特征调整预测的 选择掩码 (Selection Mask),决定哪些维度由位置控制,哪些维度由力控制(Hybrid Force-Position Control)。

为了解决切换时的“震荡”问题,作者引入了 动态时间规整 (DTW) 算法。它能自动对齐预测轨迹和已执行的历史轨迹,丢弃掉那些因为延迟导致的“陈旧”点位,确保平顺过渡。


4. 实验战绩:极致的力控表现

在名为 “Push and Flip”“Plug in EV Charger” 的高难度任务中,Force Policy 展示了统治级的表现。

  • 精准调控:在翻转重物时,Force Policy 能够完美复刻演示中的 15N 作用力,而基线模型要么推得太猛导致失败,要么力太小翻不过去。
  • 泛化之王:面对从未见过的紫色方块、软海绵或者不规则的圆柱体,Force Policy 凭借视觉端的通用性和力觉端的适应性,成功率远超 ForceVLA。

实验结果对比 图 2:在撕标签任务中,Force Policy(红色)的力曲线与人类演示(灰色)高度重合


5. 总结与洞察 (Takeaway)

Force Policy 的成功不仅在于网络结构的精巧,更在于对 经典控制理论 (Hybrid Force-Position Control) 的尊重与重塑。

  • 模块化设计的胜利:通过解耦快慢策略,开发者可以独立升级视觉主干网络(如换成更强的 VLA 模型),而不必担心破坏底层的力控逻辑。
  • 零样本泛化的启示:局部策略不关心物体的长相,只关心“摸起来是什么感觉”。这种对物理接触属性的建模,是机器人走向非结构化环境的关键。

局限性:目前该系统尚不支持复杂的切削等破坏性任务。未来的方向可能包括将接触点估计 (Contact Point Estimation) 纳入其中,以支持更精细的扭矩控制。


本文是对 arXiv 最新论文《Force Policy: Learning Hybrid Force-Position Control Policy under Interaction Frame for Contact-Rich Manipulation》的深度解读。

发现相似论文

试试这些示例

  • 查找最近一年内其他采用“视觉-力觉解耦”架构(类似 Global-Local 策略)解决机器人接触任务的 CVPR 或 ICRA 论文。
  • 深入研究“任务坐标系形式化 (Task Frame Formalism, TFF)”的历史渊源,以及本文提出的 Interaction Frame 在处理非刚性接触时有哪些理论突破?
  • 调研动态时间规整 (Dynamic Time Warping, DTW) 在机器人 Action Chunking 轨迹平滑和延迟补偿中的其他应用案例。
目录
[Force Policy] 突破接触操作瓶颈:像人类一样感知视觉与力的平衡
1. TL;DR
2. 1. 痛点:为什么端到端力觉策略总是不够稳?
3. 2. 核心技术:回归物理本质的 Interaction Frame (IF)
4. 3. 架构解析:双速率异步调度器 (Dual-Policy Scheduler)
5. 4. 实验战绩:极致的力控表现
6. 5. 总结与洞察 (Takeaway)