模仿学习能让机器人训练提速多少?
与需要数百万次试错尝试的传统强化学习相比,模仿学习能大幅缩短教会机器人新技能所需的时间。机器人无需从零开始探索行为模式,而是直接通过人类示范进行学习,通常仅需一次示范就能泛化到新场景中[4][7]。例如,WHIRL系统仅凭一段非结构化的人类视频就能学会新任务,并在现实世界中执行该任务[7]。
在一项涵盖超过100种不同任务的大规模研究中,名为BC-Z的系统在24项完全未见过的操作任务上实现了44%的成功率,且这些任务没有任何机器人演示数据[2]。这表明模仿学习能够提供有意义的泛化能力,尽管成功率远未达到完美。对于结构化的简单任务,例如使用KUKA机械臂进行抛光,模仿学习在准确性和效率上均优于其他方法[1]。
模仿学习的主要局限与失效场景
最大的挑战在于,简单的模仿学习(行为克隆)往往在长周期任务中失败,因为微小误差会随时间累积。一项关于灵巧双臂操作的研究发现,以往将感官输入直接映射为动作的方法会受此类累积误差影响,因此他们提出了一种双动作方法:在大部分任务中使用基于轨迹的全局动作,仅在需要精细操作时采用反应式局部动作[3]。这一设计成功完成了更简单方法无法实现的剥香蕉皮任务。
另一个限制是人体与机器人之间的“领域差异”。人类和机器人拥有不同的外形、尺寸和关节结构,这使得直接模仿变得困难。一种解决方案是使用与机器人运动学匹配的主控制器,无需双向遥操作系统即可实现力反馈,该方法已在开瓶盖任务中成功测试[5]。另一种方案是像“机器人遥动”这样的系统,它仅通过单个RGB摄像头,并利用海量互联网视频数据进行训练,将人类手部动作实时映射到机器人手上,使未经训练的人也能远程操控机器人完成灵巧任务[8]。
交互式模仿学习(IIL)通过在机器人执行过程中引入人类反馈,解决了部分上述问题。该方法能够在线纠正错误,提升数据效率与鲁棒性[9]。对于机器人轨迹可能偏离示范轨迹的任务,这一方法尤为有价值。
模仿学习在何种条件下、对谁最有益?
模仿学习最适用于那些难以通过分析建模、但人类易于演示的任务,例如可变形物体操作(如倒饮料、剥香蕉)或需要力反馈的任务(如拧开瓶盖)[3][5][6]。在服务机器人领域,一种可解释的分层模仿学习方法在倒饮料任务中,其成功率、适应性和可解释性均优于传统的行为克隆方法,使机器人能够泛化到未见过的容器上[6]。
该方法对于需要模仿人际互动的社交机器人也颇具前景。研究人员专门创建了一个多模态数据集(LISI-HHI),用于建模非语言社交信号并将其迁移至机器人,这凸显了该领域日益增长的研究兴趣[10]。然而,成功的关键条件包括:拥有高质量的示范数据、能够处理人机具身差异,以及通常需要某种结构化学习或交互式纠错机制来避免误差累积。对于需要高精度或长序列执行的任务,简单的行为克隆往往难以胜任,但更高级的模仿学习方法(如结构化预测、目标条件动作、交互式反馈)则能发挥显著效果。
关于这些来源
该回答基于10篇经同行评审的研究——发表于2021年至2024年间,其中2篇发表于2024年或更晚,2篇发表于Q1期刊,总被引次数达1004次——这些研究是从通过质量筛选的10篇文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的32篇文献。
本文引用的文献
一种用于机器人模仿学习的结构化预测方法
提出了一种用于模仿学习的结构化预测方法,在轨迹复现与自适应方面优于现有最先进技术,并通过KUKA机械臂的抛光任务进行了验证。
BC-Z:基于机器人模仿学习的零样本任务泛化
BC-Z系统在超过100种不同任务上训练后,在24项未见过的操作任务中实现了44%的平均成功率,展示了从模仿学习中进行零样本泛化的能力。
面向灵巧双臂机器人操作的目标条件双动作模仿学习
目标条件双动作深度模仿学习通过结合基于轨迹的全局动作与反应式局部动作,有效避免了复合误差,从而在真实双臂机器人上成功实现了香蕉剥皮操作。
机器人对人类行为的模仿
一种新方法利用单次人类演示、扩散动作分割和开放词汇目标检测,使机器人能够通过符号推理和逆运动学来抽象并复现任务。
无机器人训练:面向主端到机器人策略迁移的深度模仿学习
采用配备匹配运动学与力/扭矩传感器的控制器,结合基于注视的模仿学习与Transformer策略的主-机器人策略迁移系统,在需要力反馈的瓶盖开启任务中取得了成功。
可解释的分层模仿学习在机器人倒酒任务中的应用
可解释的分层模仿学习在倒水任务中,其成功率、适应性、可操作性和可解释性均优于传统行为克隆方法,并能够泛化至未见过的容器。
自然、流畅的中文翻译如下: 野外环境中的人对机器人模仿
WHIRL算法实现了在真实环境中的一次性视觉模仿,能够直接从非结构化的人类视频中学习,并泛化到新任务中。
机器人遥操作:通过观看YouTube上的人类行为学习机械手模仿
机器人遥操作灵巧手系统仅需单个RGB摄像头,并利用互联网上的人类手部视频进行训练,即可实时将人类手部动作映射到机器人手上,使未经训练的人员也能远程操控机器人完成精细操作任务。
机器人中的交互式模仿学习:综述
对交互式模仿学习(IIL)的综述发现,该方法具有数据高效性和鲁棒性,原因在于人类反馈在机器人执行过程中实时提供,从而纠正了教师轨迹与学习者轨迹之间的分布不匹配问题。
用于机器人学习模仿社交性人际互动的多模态数据集
LISI-HHI是一个多模态双人交互数据集(包含动作捕捉、RGB-D、眼动追踪器和麦克风),专为评估人机交互中的社交模仿学习而设计。
