长时程基准测试究竟遗漏了什么?
长程技能任务通常衡量智能体能否执行一系列技能以达到目标,但很少检验智能体是否从一开始就学会了选择正确的技能。一篇2026年的论文指出,这是一个结构性缺陷:技能选择决策——即读取哪个技能文件或调用哪个技能——是由策略本身在回合中途做出的,然而现有训练信号中没有任何一项直接对此进行教导[1]。换言之,基准测试奖励的是结果(任务是否成功?),而非选择(智能体是否在众多候选技能中选对了?)。
论文将这一根本问题命名为“选择器信用匮乏”:在标准的结果奖励强化学习框架下,命名所选技能的少数几个token在损失中占比微乎其微,而它们继承到的信用随着轨迹变长,错误符号的比例也越来越大[1]。具体而言,当技能选择正确时,只要其后的执行失败,该选择就会受到惩罚,尽管这一选择本是整个回合中最有价值的决策之一。这意味着,仅报告最终成功的基准测试可能掩盖一个事实:智能体的技能选择策略实际上几乎未经训练——它可能靠运气或读取大量技能而成功,而非真正学会挑选正确的技能。
为什么仅仅奖励最终结果,无法教会技能选择?
默认的补救措施——在候选列表上进行基于结果奖励的强化学习——无法教会技能选择,这有其结构性原因。在广播式、序列级别的优势中,一次成功回合的功劳被分摊到所有词元上,因此技能命名词元只获得更新中极小的一部分[1]。论文对一次完整运行训练产物的审计证实了三个特性:功劳份额趋近于零,随着轨迹变长,其符号错误越来越严重,且这三者都随任务时域单调恶化[1]。这意味着在长时域任务中,技能选择信号不仅微弱——它还会主动误导策略。
实际后果是,仅用结果奖励训练的智能体在基准测试上可能看似有所提升,但其技能选择行为实际上并未被塑造。2026年的研究显示,当同样的预算用于技能命名token的专用动作局部优势(SkillGate)时,一个9B参数的策略在五个智能体基准测试中,从16个候选技能列表中,试验成功率从40.8%跃升至53.2%[1]。这12.4个百分点的提升——约30%的相对改进——源于修复了选择决策的信用分配问题,而非更好的执行能力。同一方法还将暴露于误导性候选的比例降低了三分之二,并减少了读取的技能数量,表明智能体学会了更具选择性,而不仅仅是更成功。
技能选择是否是一个独立于技能执行的问题?
是的——其他研究的证据也指向同样的结论。2023年一项机器人学研究(LEAGUE)将任务规划与基于强化学习的技能学习相结合,并明确区分了符号接口(使用哪种技能)与底层技能执行[2]。该研究表明,在任务规划器的指导下进行技能学习——即由规划器决定学习何种技能以及何时学习——能使系统逐步扩展能力,并在新任务中复用已有技能[2]。这支持了这样一种观点:技能选择是一个独立的决策层,需要其自身的训练信号,而非从执行层面的奖励中自动涌现出来的结果。
2021年一项关于技能序列依赖策略的研究提出了一个互补的观点:长时程任务仅凭当前观测并不具备马尔可夫性质——技能的顺序本身至关重要[3]。其分层策略包含一个高层技能策略,显式地以技能序列为条件,以及一个低层参数策略,负责响应观测,其学习速度显著快于标准PPO(近端策略优化)[3]。综合来看,这些研究从不同角度得出了相同的结论:技能选择是一种可学习的、感知序列的决策,需要专门的结构来支撑,而仅衡量最终成功的基准测试可能掩盖这一层面的失败。2026年的SkillGate论文是最直接的证据,因为它将选择信号单独分离出来,并展示了通过显式训练该信号所带来的巨大性能提升[1]。
关于这些来源
这个回答基于3项研究(2项经同行评审,1项为预印本),发表于2021年至2026年间,其中1项为2024年或之后发表,1项发表于Q1–Q2期刊。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的29篇文献。
本文引用的文献
SkillGate:在长周期智能体中训练策略内技能选择
针对结果奖励强化学习中的技能选择问题,识别出“选择器信用匮乏”现象,并证明该问题随任务时域延长而加剧;据此提出SkillGate方法,在包含16个候选技能的五项基准测试中,将9B策略的试验成功率从40.8%提升至53.2%,同时将暴露于误导性候选技能的比例降低三分之二。
LEAGUE:面向长时程操作任务的引导式技能学习与抽象
LEAGUE将任务规划与基于强化学习的技能学习相结合,通过符号接口指导学习哪些技能以及何时学习,从而实现技能复用和能力的持续增长,并在四个模拟任务域中验证了该方法,同时成功迁移至实体机器人。
学习一种依赖于技能序列的策略,用于长时程操作任务
提出了一种面向长时程操作任务的技能序列依赖分层策略,其中高层技能策略以技能序列为条件,低层参数策略则响应观测信息,在仿真中其学习速度显著快于PPO及任务模式方法。
