为何逐一审查每个输出无法实现快速技能选择
当智能体能够快速生成大量输出时,人工逐一检查便成为瓶颈。本文所引论文提出了一种更优的思路:将质量控制直接嵌入技能选择机制本身。例如,LEAGUE将技能学习与任务规划器相结合,规划器的符号接口引导哪些技能被学习与复用——这减少了对每个动作进行验证的需求,因为规划层已先行过滤了可行性[1]。类似地,像MADyS这样的自适应技能选择方法采用双层框架,由高层策略根据局部奖励和团队目标在每一时刻挑选最合适的技能,而非依赖单一密集奖励来评判每个输出[5]。其启示在于:质量控制应成为选择策略的内在属性,而非对每个输出的事后审查。
使用价值函数来判定哪些输出“足够好”
一种实用的质量控制机制是,用价值函数为每个可能的状态或输出打分,预测其最终成功的概率。ViSkill在手术机器人任务中正是这样做的:它学习一个状态价值函数,从给定状态估算整个任务的预期成功概率,并据此决定子任务何时应终止[4]。这种方法之所以强大,是因为它不仅仅检查即时输出看起来是否正确——它还检查该输出是否为后续步骤的成功奠定了基础。在他们的实验中,这种基于价值信息的链接方式在复杂手术任务中实现了较高的任务成功率,优于未采用此类价值门控的方法[4]。对你的应用场景而言,这意味着即使某个输出单独看起来合理,你也可以自动拒绝那些会导致低价值状态的输出。
自适应选择与人类对齐奖励,捕捉规则所遗漏之处
质量控制还意味着确保智能体不会困在技能空间的狭窄区域。张等人表明,在基于技能的强化学习中,只有潜在技能空间的一小部分与给定状态相关,因此随机探索会浪费时间并产生较差的输出[2]。他们的三层方法使用高层策略来选择技能类别,然后通过条件模型将探索引导至与状态相关的区域——这显著加速了探索和跨任务学习[2]。这是一种质量控制形式,因为它防止智能体从无关技能生成输出。此外,马等人解决了输出与人类常识对齐的问题:他们使用视觉-语言模型作为势函数来塑造奖励,并采用自适应模块根据指令和视频回放选择正确的势函数[3]。这有助于确保即使输出速度快,也具有语义合理性,而不仅仅是统计上的可能性。关键在于:这些方法需要训练数据或预定义的技能池,因此当技能空间具有一定结构时,它们效果最佳。
关于这些资料来源
本回答基于5项同行评审研究——发表于2021年至2025年间,其中2项为2024年或之后发表,2项发表于Q1–Q2期刊——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这5项研究又源自从超过5亿篇论文数据库中检索到的40篇文献。
本文引用的文献
LEAGUE:面向长时程操作任务的引导式技能学习与抽象
LEAGUE将任务规划器与基于强化学习的技能学习相结合,通过符号接口引导技能的获取与复用,并在四个模拟的长时程操作任务中大幅超越基线方法。
自适应技能选择以有效探索动作空间
一种三层自适应技能选择方法,利用高层策略和条件概率模型,在三个具有挑战性的操作任务中显著加速了探索和跨任务学习。
基于视觉的通用势函数用于多智能体强化学习中的策略对齐
一种基于视觉的分层奖励塑形方法,利用视觉语言模型作为势函数,并引入自适应技能选择模块,使策略与人类常识对齐,在谷歌研究足球环境中实现了更高的胜率。
基于价值信息的技能链式策略学习用于手术机器人长时程任务
ViSkill引入了一个状态价值函数,用于估计预期成功概率以指导技能链式组合,在三个复杂的手术机器人任务上实现了高任务成功率和执行效率。
用于学习联合动作的动态技能选择
MADyS采用双层优化框架结合进化算法,在局部技能之间动态切换,在具有空间和时间耦合的环境中优于先前的方法。
