[CoRL 2024] UPS:当机器人犹豫时,它应该执行、询问还是学习?
When to Act, Ask, or Learn: Uncertainty-Aware Policy Steering
本文提出了 UPS (Uncertainty-aware Policy Steering) 框架,旨在解决机器人策略导向中 VLM 验证器的过度自信问题。通过结合 Conformal Prediction 和贝叶斯意图推理,系统能够自主判断何时执行动作、何时进行语言澄清或请求人工干预,在复杂任务中实现了统计意义上的成功率保证。
TL;DR
传统的机器人策略往往“盲目自信”,即使没听懂指令或做不到任务也会强行尝试。Carnegie Mellon University 提出的 UPS (Uncertainty-aware Policy Steering) 框架通过 Conformal Prediction 和贝叶斯意图分析,赋予了机器人识别自身“无能”的能力。它能精确区分:这是个好动作(执行)、我不确定你要哪个(提问)、或者我根本不会做(请求演示并学习)。
背景定位:解决 VLM 验证器的“迷之自信”
随着 Diffusion Policy 等生成式策略的普及,Policy Steering (策略导向) 成了提升部署性能的关键:先生成一堆动作样本,再找个“验证器”(通常是 VLM)挑个最好的。
然而,目前的验证器存在严重的过度自信 (Overconfidence) 倾向。当用户说“帮我清理下桌子”时,桌上有两个筐,VLM 可能会随机盲选一个执行,而不是询问用户要放哪个。当底层策略根本无法完成精密操作时,VLM 也会在“烂苹果”里挑一个,导致任务失败。
核心动机:区分语义歧义与动作无能
作者认为,不确定性来源于两个层面:
- 高层语义歧义 (Semantic Uncertainty):指令含糊(如“左边”还是“右边”?)。
- 底层动作无能 (Action Incapability):预训练策略生成的动作样本全是错的。
方法论详解:UPS 框架的三个支柱
1. 动作后果的“文本化”翻译
UPS 并不直接让 VLM 看原始动作序列,而是利用 World Model (世界模型) 预测动作执行后的未来画面,再将其转化为文字描述(Outcome Narration)。这种“升维”让 VLM 能够充分发挥其推理长处。
2. 贝叶斯意图分解 (Bayesian Intent Factorization)
为了防止 VLM 直接拍脑袋给分,作者将其推理过程分解为:
- Step 1: 推测可能的隐藏意图 (用户可能是左撇子还是右撇子?)。
- Step 2: 计算给定意图下,某个动作成功的概率。 最后通过边缘化概率处理,迫使模型关注到那些它平时会忽略的边缘可能性。
3. 符合预测 (Conformal Prediction) 校准
这是 UPS 的数学内核。通过在校准集上计算非对称得分,它能生成一个包含所有“可信”选项的预测集 (Prediction Set)。
- 单元素集合:信心十足,直接执行。
- 多元素集合:存在歧义,发起提问(Ask)。
- 空集/空选项:识别到能力不足,请求人工干预(Learn)。
图 1: UPS 整体框架,展示了从动作采样到校准验证,再到策略决定的完整回路。
实验战绩:更聪明地“搬砖”
在 Franka 机器人真机实验中,UPS 展现了极强的鲁棒性:
- 歧义处理:在用户指令模糊时,成功率比 Forewarn 提升了 15%-30%。
- 人工效率:相比传统的 DAgger 系列方法,UPS 极大减少了对人类的“骚扰”。它只在真正不会做的时候才求助,人工干预率显著更低。
图 2: 硬件实验中的不确定性定量分析。可以看到 UPS (红色) 在覆盖率和集合大小之间取得了最佳平衡。
深度洞察
UPS 的核心贡献在于它提供了一种闭环学习的优雅方式。它不仅是让机器人学会提问,更重要的是通过 Residual Learning (残差学习) 将人类的干预实时补丁到现有策略中。这意味着机器人不再是一成不变的工具,而是一个在交互中不断扩充边界的智能体。
总结与局限
总结:UPS 成功将统计校准理论引入了 VLM 导向的机器人控制中,解决了“大模型懂语义但不准”的痛点。 局限性:目前系统重度依赖世界模型(World Model)的预测准确度。如果世界模型“看走眼”了,后续的文本描述和验证也会南辕北辙。未来的研究方向在于如何将世界模型本身的不确定性也纳入校准体系中。
Takeaway for Practitioners: 对于具身智能开发者,不要迷信 VLM 的推理得分,引入 Conformal Prediction 等校准工具是提升系统在真实场景安全性和可靠性的必经之路。
