为什么智能体在长任务中会重复犯错?核心问题在于信用分配,而非记忆。
长程智能体之所以会重复犯错,最大的原因在于标准训练信号——即对整个回合进行奖励——无法告诉智能体究竟是哪个决策导致了失败。在长任务中,那些指明所选技能的少数几个token在损失中占比微乎其微,而随着轨迹变长,它们所继承的信用分配错误方向的程度也越来越严重。这被称为“选择器信用匮乏”,而且这是一个结构性问题:一个正确的技能选择,如果其后的执行失败,就会受到惩罚,尽管这个选择本身才是最关键的决策[2]。正因如此,仅仅增加记忆容量或训练数据并不能解决问题——智能体始终学不会该选哪个技能。
修复方法是为技能选择决策提供独立的奖励信号,与执行过程分开。SkillGate通过将令牌支持划分为两个互不重叠的信用通道来实现这一点:结果信用仅到达执行令牌,而一个独立的动作局部优势则精确到达技能命名令牌,且仅在轨迹中的单次读取为正确时产生正值[2]。在五个智能体基准测试中,使用包含16个候选技能的列表,该方法将9B参数策略的试验成功率从40.8%提升至53.2%——跃升了12.4个百分点——同时将接触误导性候选的概率削减了三分之二,并减少了技能读取次数[2]。将相同预算仅用于结果奖励时,效果微乎其微,这证实了问题在于训练信号,而非模型规模。
即使训练得当,记忆也可能被污染——这时智能体就会重蹈覆辙。
长程智能体通常依赖外部记忆来记住哪些做法有效、哪些无效。然而,如果这些记忆被噪声或失败的尝试填满,智能体可能会检索到错误的示例,从而重复同样的错误。在一项包含75%合成干扰物的受控压力测试中,无界记忆和简单的FIFO(先进先出)逐出策略均表现严重退化:Precision@5(前5个检索结果中相关记忆所占比例)从20.2%降至12.4%(无界记忆),从15.8%降至3.8%(FIFO)[1]。简而言之,智能体在大多数情况下检索到的都是错误的记忆。
一种选择性保留策略——TraceRetain——通过可解释的特征(如成功率、时效性、访问频率和冗余度)为每条记忆条目打分,并在容量达到上限时淘汰得分最低的条目。在相同噪声条件下,TraceRetain使Precision@5基本保持不变(从16.9%到16.6%),并保留了97/100的任务成功率[1]。其机制颇具启发性:无界记忆的平均相似度最高(0.87),但精确度最低,这意味着失败的干扰项在嵌入空间中与查询非常接近——因此智能体在自信地检索错误内容。这表明,记忆卫生与训练信号同样重要,是避免重复犯错的关键。
策略内技能选择何时真正有用?只有当任务足够长且噪声足够大时。
这些方法的好处并非普遍适用。在干净、饱和的基准测试中,采用不同保留策略的记忆增强策略,其表现均在统计误差范围内彼此接近——差异落在Wilson 95%置信区间内[1]。换言之,如果任务简单且记忆流干净,任何合理的记忆策略都能奏效,而选择性保留带来的额外复杂性几乎无增益。其优势仅在流中包含噪声或干扰项时显现,而这恰恰是错误可能在长时程中累积放大的情境。
同样地,当任务较长时,信用分配修正的作用最为关键。SkillGate论文表明,信用匮乏问题会随着时间跨度的增加而单调恶化[2]。因此,对于短任务,基于结果奖励的强化学习或许已足够;但对于长程多步任务,技能选择决策变得过于重要,不能让其仅依赖于损失中占比微乎其微的部分。这与机器人学中的发现一致:那些显式串联技能并学习转换策略的方法(如课程引导的技能链式连接[3]或依赖技能序列的策略[5])在长时程任务上优于扁平式强化学习方法,因为它们将问题分解为可管理的片段,并学习何时进行切换。结论是:策略内技能选择并非万能灵药,但在任务较长且环境嘈杂时,它是必要的。
关于这些来源
这个回答基于5项研究(3篇经同行评审,2篇为预印本),发表于2021年至2026年间,其中3篇为2024年或之后发表,1篇发表于Q1期刊。这些研究是从6项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索出的41篇文献。
本文引用的文献
面向长时程LLM智能体的选择性记忆保留
在受控的噪声写入压力测试中(75%的合成干扰项),无界内存和FIFO逐出策略分别将Precision@5从20.2%降至12.4%、从15.8%降至3.8%,而TraceRetain则使其几乎保持不变(16.9%至16.6%),并保留了97/100的任务成功率;在干净基准测试中,不同保留策略之间没有显著差异。
SkillGate:在长周期智能体中训练策略内技能选择
将“选择器信用匮乏”识别为结果奖励强化学习在技能选择上的结构性缺陷,并提出了SkillGate,该方法将信用划分为独立通道;在包含16个候选项目的五个智能体基准测试中,SkillGate将9B策略的试验成功率从40.8%提升至53.2%,同时将接触误导性候选项目的概率降低了三分之二。
面向长时程机器人操作任务的课程引导式技能学习
提出了一种课程引导的技能链式算法,该算法仅需一次演示即可学习技能之间的转换策略,在机器人操作任务上达到了与依赖大量数据的方法相当的性能,并实现了技能的零样本复用。
基于示例驱动的模型强化学习用于解决长时程视觉运动任务
我们提出了EMBER,一种基于模型的强化学习方法,通过成功分类器学习一组基础技能并支持重试,使Franka机器人能够以85%的成功率完成三项长时程视觉运动任务,可依次执行多达12个技能,涉及14种独特的基础动作。
学习一种面向长时程操作任务的技能序列依赖策略
提出了一种依赖于技能序列的分层策略,该策略同时利用观测和技能序列,在仿真中解决长时程任务的速度显著快于PPO和任务模式方法。
