变化之处:从微观管理每一步到宏观监督全局
较早期的长时程机器人操作方案通常假设,机器人需要人类预先指定每一个动作,或者一旦编程完成就能完全自主运行。近期研究打破了这种非此即彼的二元模式。新的图景是一种协作关系:机器人的智能体记忆系统(负责记住上下文、规划和过往步骤的系统)处理常规细节,而人类仅在关键时刻介入——当计划需要修正、机器人感到不确定,或任务需要做出判断时。
2024年一项关于RoboVQA的研究证据直接印证了这一转变。作者训练了一个视频条件模型,引导机器人在真实办公环境中完成长时程任务,并明确内置了“干预机制”,允许在模型不完美时由人类接管。这使得机器人即便在模型存在缺陷的情况下也能将任务执行到底,并且与零样本的先进视觉语言模型基线相比,认知干预率降低了46%[1]。通俗地说,人类无需逐帧监控——只在机器人自身置信度较低时才介入,这使人类需要干预的次数减少了近一半。
人类如何真正保持“人在回路”:纠正、示范与高层指令
这些论文一致指出了人类保持参与其中的三种具体方式:(1)提供期望行为的示范,(2)在机器人出错时给予实时纠正,以及(3)发出高层指令,由机器人的记忆将其转化为计划。这三种方式并非相互排斥——最强大的系统会将它们结合起来。
《科学机器人学》2025年的一项研究采用人在回路强化学习,用于精密装配和双臂协调等灵巧操作任务。该系统整合了示范、人工纠正和样本高效的强化学习算法,并直接在真实世界中进行训练。在1至2.5小时内,它通过将任务成功率提升2倍(接近完美成功率)并以平均1.8倍的速度执行任务,超越了基线水平[2]。关键在于:人类并未对机器人进行编程,而是向其展示该做什么,并在出错时予以纠正,而机器人的记忆(即强化学习策略)则从这些纠正中学习。
另一项2024年关于基于大语言模型操控的研究,利用提示式GPT-4将高层语言指令分解为可执行的运动序列,并将遥操作与动态运动基元(DMP)相结合,使机器人能够从人类示范中学习。结果表明,需要复杂轨迹规划和环境推理的任务,通过人类引导得以高效完成[3]。这表明,即使机器人拥有强大的语言模型“记忆”,它仍需要人类提供物理示范,以将计划落实于现实之中。
人类干预最有用的时机:在计划层面,而非像素层面
证据表明,人类最有效的角色在于任务规划和故障恢复层面,而非低层次的运动控制。2025年一项关于四足机器人结合大语言模型的研究构建了一个多智能体系统,包括语义规划器、参数计算器、代码生成器,以及一个负责处理“执行失败或人工干预”的重新规划器[4]。该设计明确为机器人遇到自身无法独立解决的问题时预留了人类输入的接口——例如需要制造工具或通知人类寻求帮助的情况。人类并不控制机器人的腿部动作,而是在战略层面进行干预。
这与RoboVQA的发现一致,即视频条件模型在错误减少方面比单图像模型高出19%,这意味着机器人对过去视频帧的记忆有助于其做出更好的决策,从而减少对人工监督的需求[1]。机器人能记住并推理自身历史的能力越强,人类需要介入的程度就越低。但在机器人记忆不足的时刻,人类仍然不可或缺——这正是[4]中重规划器所设计应对的场景。
关键在于:人工监督仍不可少,界面设计同样重要
这些系统均未宣称具备完全自主性。RoboVQA论文明确指出,与零样本最先进模型之间的性能差距表明,要实现实际部署,仍需收集大量基于实地的数据[1]。换言之,机器人的记忆能力尚不足以独立完成任务。而人机交互界面的质量,则直接影响人类能否有效保持在回路中。
2021年一项关于软体机器人操纵器遥操作界面的研究发现,与直接控制界面(用户直接操控关节运动)相比,使用间接控制界面(用户指定目标而非直接进行关节运动)时,用户操作效率更高、错误更少,并认为其更易用[5]。这提醒我们,“保持人在回路中”不仅关乎何时介入,更关乎如何介入。如果界面笨拙,人就会成为瓶颈。上述研究表明,赋予人高层级控制权(目标、修正、指令)而非低层级关节控制,既更高效,也更易用。
关于这些资料来源
本回答基于5项同行评审研究——发表于2021年至2025年间,其中4项为2024年或之后发表,1项发表于Q1期刊,合计被引用124次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的51篇文献。
本文引用的文献
RoboVQA:面向机器人的多模态长时程推理
RoboVQA提出了一种可扩展的数据采集方案,并构建了一个以视频为条件的模型。借助人工干预机制,该模型即便存在不完美之处,也能完成长时程任务,与零样本VLM基线相比,认知干预率降低了46%;而视频条件化处理平均使错误率下降了19%。
通过人在回路强化学习实现精准灵巧的机器人操作
一个结合了人类示范与人工修正的人机协同强化学习系统,在1至2.5小时的真实世界训练内,于灵巧操作任务上实现了近乎完美的成功率,相比基线方法,任务成功率提升了2倍,执行速度提升了1.8倍。
通过人机协作增强基于大语言模型的机器人操作
基于GPT-4的LLM操控系统,通过任务分解和结合动态运动基元的人类遥操作,使得复杂的轨迹规划和环境推理任务能够通过人类演示高效完成。
基于大语言模型的四足机器人长时域运动与操作
一个基于LLM的四足机器人系统采用多个智能体(语义规划器、参数计算器、代码生成器、重规划器)来处理长时程任务,其中重规划器专门设计用于应对执行失败或人类干预,从而实现了诸如制造工具或通知人类寻求帮助等非平凡行为。
软体机器人操纵器的人机遥操作界面评估
一项关于软体机器人操纵器遥操作界面的用户研究发现,无论使用何种硬件设备,间接控制型人机交互界面(基于目标)在操作效率、错误率以及可用性评分方面均优于直接控制型人机交互界面。
