[Force Policy] 突破接触操作瓶颈:像人类一样感知视觉与力的平衡
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
本文提出了 Force Policy,一种受人类感官分工启发的全局-局部视觉-力觉协作策略。该方法通过从演示中提取物理意义明确的“交互坐标系 (Interaction Frame, IF)”,实现了在复杂接触任务中将视觉引导的运动与高频力反馈控制解耦,达到了领域领先的 SOTA 性能。
TL;DR
在机器人挑战接触密集型任务(如插拔充电头、撕除顽固标签)时,传统端到端策略往往在“泛化能力”和“力控精度”之间顾此失彼。上海交大与 Flexiv 团队联合推出的 Force Policy 提出了一个巧妙的解方案:仿照人类的分工,让视觉(低频)管“去哪里”,让力觉(高频)管“怎么摸”。通过引入显式的物理 Interaction Frame (IF),该方法在保持强大泛化性的同时,实现了极其稳定的力位混合控制。
1. 痛点:为什么端到端力觉策略总是不够稳?
在工业级或家庭场景中,接触密集型操作 (Contact-rich Manipulation) 极难。
- 模态冲突:力信号充满噪声。如果直接拼接到 Vision Transformer 中,这些高频抖动往往会带偏长程视觉规划。
- 逻辑耦合:现有的 SOTA 方法(如 RDP)往往让快慢策略强耦合,一旦视觉端预测稍有偏差,快速反馈环节就会因为超出分布 (OOD) 而产生灾难性抖动。
- 结构缺失:机器人不知道自己在“摸什么”。如果没有一个物理坐标系,机器人很难区分什么是“摩擦力”,什么是“几何约束”。
2. 核心技术:回归物理本质的 Interaction Frame (IF)
本文最深刻的 Insight 在于对 Interaction Frame (IF) 的重新定义。作者不再依赖已知的 CAD 模型,而是从能量消耗的角度出发:
- 耗散残差 (Dissipative Residual):源于摩擦或粘性损耗。
- 结构残差 (Structural Residual):源于环境刚度。
通过 Gemini 3 Pro 识别任务阶段,模型能自适应地从演示数据中恢复出当前的交互轴。例如,在撕标签任务中, 轴对齐法向量,而 轴自动对齐运动方向。
图 1:Force Policy 架构 - 全局视觉指导与局部力反馈执行的二重奏
3. 架构解析:双速率异步调度器 (Dual-Policy Scheduler)
Force Policy 由两部分组成:
- Π_global (低频视觉策略):基于 RISE-2,利用 3D 点云提供全局语义和几何特征 。
- Π_local (高频力策略):这是一个 50Hz 的快速循环。它根据全局特征调整预测的 选择掩码 (Selection Mask),决定哪些维度由位置控制,哪些维度由力控制(Hybrid Force-Position Control)。
为了解决切换时的“震荡”问题,作者引入了 动态时间规整 (DTW) 算法。它能自动对齐预测轨迹和已执行的历史轨迹,丢弃掉那些因为延迟导致的“陈旧”点位,确保平顺过渡。
4. 实验战绩:极致的力控表现
在名为 “Push and Flip” 和 “Plug in EV Charger” 的高难度任务中,Force Policy 展示了统治级的表现。
- 精准调控:在翻转重物时,Force Policy 能够完美复刻演示中的 15N 作用力,而基线模型要么推得太猛导致失败,要么力太小翻不过去。
- 泛化之王:面对从未见过的紫色方块、软海绵或者不规则的圆柱体,Force Policy 凭借视觉端的通用性和力觉端的适应性,成功率远超 ForceVLA。
图 2:在撕标签任务中,Force Policy(红色)的力曲线与人类演示(灰色)高度重合
5. 总结与洞察 (Takeaway)
Force Policy 的成功不仅在于网络结构的精巧,更在于对 经典控制理论 (Hybrid Force-Position Control) 的尊重与重塑。
- 模块化设计的胜利:通过解耦快慢策略,开发者可以独立升级视觉主干网络(如换成更强的 VLA 模型),而不必担心破坏底层的力控逻辑。
- 零样本泛化的启示:局部策略不关心物体的长相,只关心“摸起来是什么感觉”。这种对物理接触属性的建模,是机器人走向非结构化环境的关键。
局限性:目前该系统尚不支持复杂的切削等破坏性任务。未来的方向可能包括将接触点估计 (Contact Point Estimation) 纳入其中,以支持更精细的扭矩控制。
本文是对 arXiv 最新论文《Force Policy: Learning Hybrid Force-Position Control Policy under Interaction Frame for Contact-Rich Manipulation》的深度解读。
