[RSS 2024] 机器人如何“像人一样”削果皮:对齐精细操控与人类偏好
How to Peel with a Knife: Aligning Fine-Grained Manipulation with Human Preference
本文提出了一个两阶段机器人学习框架,旨在解决精细、高接触力和受主观评价驱动的复杂操控任务(如用刀削皮)。该方法结合了力感知模仿学习与基于人类偏好的残差策略微调(RLHF),在土豆、苹果、黄瓜等多种农产品上实现了超过 90% 的平均成功率。
TL;DR
机器人削苹果皮不难,但削得“像大厨一样好”很难。本文提出了一种结合力感知模仿学习与人类偏好微调 (Preference-based Finetuning) 的两阶段框架,让机器人不仅能完成削皮动作,还能在力度控制、厚度均匀度和美观度上对齐人类的审美标准。
核心定位
这是一项结合了 Robotics 与 RLHF (Reinforcement Learning from Human Feedback) 的前沿工作。它将大语言模型中的“偏好对齐”思想引入到物理世界中极其困难的“削皮”任务中,解决了判别准则模糊、物理动态复杂的双重困境。
痛点深挖:为什么“削皮”是机器人学的噩梦?
在学术界,传统的 Pick-and-place 任务成功标准很明确(物体进了篮子就是成功)。但削皮任务不同:
- 接触动力学极端复杂:刀片在不规则表面(如土豆凹坑)滑动的力矩平衡极易崩溃。
- “好”的定义很主观:多厚的皮算“厚”?切口断断续续是否合格?这些连续且定性的评价无法用简单的数学公式表达。
- 数据饥渴:现有的力控方法依赖昂贵的力觉示教,难以通过大规模数据直接堆砌。
核心方法论 (Methodology)
1. 两阶段“对齐”算法流程
作者没有直接通过强化学习从零开始,而是采用“基准初始化 + 质量对齐”的策略:
- 阶段一:初始化基准策略。使用 SpaceMouse 电信操搜集数据。这里有一个关键直觉:作者采用了基于阻抗控制 (Impedance Control) 的顺应性控制方案,并利用 Diffusion Policy 处理多模态输入(视觉、深度、力、本体感受)。
- 阶段二:基于偏好的微调。
- 混合奖励模型:结合了 6 级的局部厚度量化(Quantitative)和 10 级的全局视觉审美评分(Qualitative)。
- 残差策略训练:固定第一阶段的 Diffusion Policy,只训练一个轻量级的残差网络(Residual Policy)。这个网络负责在原动作的基础上增加一个微小的修正值 。
图注:系统概览。左侧为力感知数据搜集,中间为 Diffusion 基准策略,右侧为基于奖励模型的偏好微调。
2. 硬件与感知方案
实验中使用了 Kinova Gen3 七自由度机械臂,并配备了 ATI mini45 六轴力/力矩传感器。特别值得注意的是,作者在末端安装了双腕部相机。
- 物理直觉:由于削皮方向固定,一个相机负责“即将削”的视角,另一个负责“已削完”的反馈,两者的融合提供了隐式的 3D 信息。

实验与战绩
该方法在极小的数据量下(50-200 次尝试)取得了令人惊讶的效果:
- 高性能:在已见过的农产品上达到了 100% 成功率。
- 泛化性:在土豆上训练的模型,能够 Zero-shot(零样本迁移)到形态完全不同的白萝卜上。
- 偏好对齐效果:经过微调后的策略,不仅成功率提升,削出的果皮长度更长、厚度更均匀,显著优于仅通过行为克隆(BC)得到的策略。
图注:微调前后的对比。可以看到微调后的动作更连贯,切片质量评分显著提高。
深度洞察:为什么 Residual RL 这么管用?
作者在消融实验中发现,如果不使用残差结构(Residual),直接微调整个 Diffusion 网络,效果会崩塌。 学术思考:Base Policy 已经学到了“如何接触表面”和“如何移动”的鲁棒特征(即 Low-level 的生存本能);而人类偏好奖励模型提供的是 High-level 的细节修正。残差结构有效地解耦了这两个不同层次的反馈,避免了微调时破坏掉已有的稳定物理感知。
局限性与展望
尽管表现惊艳,但这套框架目前依然依赖人类进行电信操示教。作者在结论中提到,未来将探索**混合自主(Mixed-autonomy)**的数据搜集方式。另外,为了减少实验中的食物浪费(Food Waste),开发高保真、可变形的仿真环境(Surrogate objects)也是必经之路。
总结
本文展示了机器人操控从“能做”向“做好”转变的路径。通过将物理世界的力交互与语义层面的偏好对齐结合,我们距离真正的“机器人大厨”又近了一步。
