变化何在:单轮反馈已不再足够
长期以来,人们一直认为,智能体技能——即一套可复用的AI智能体指令——可以通过运行、发现失败并修补这一错误来加以改进。但近期研究表明,这种方法会陷入停滞:一旦第一轮修复了单次交互所暴露的缺口,改进的梯度便会衰减,而那些仅在多轮交互中才会显现的缺陷则依然难以察觉[1]。换言之,如果只观察一次交互,你就会错过在长任务的第二步、第三步甚至第十步中发生的错误。
解决办法是从多轮交互中生成反馈。例如,SkillEvo将多轮用户模拟转化为反馈生成器:后续提问会层层暴露缺陷,因此每一轮修订既消耗反馈,又产生新反馈[1]。这一方法在六个云服务类别和九个生产技能上,比基于单轮问答驱动的进化高出15.4个百分点,比基于自我反思的进化高出23.0个百分点[1]。关键启示是:要在长任务中避免重复犯错,反馈必须来自整个交互轨迹,而不仅仅是单个问答对。
工作原理:反馈是梯度,而非单纯分数
把技能进化想象成训练模型的过程:你需要一个梯度——一个告诉你该往哪个方向调整的信号——而不仅仅是一个最终分数。SkillGrad正是通过将技能包视为一个以梯度下降方式进行优化的参数,使这一点变得明确:任务执行提供轨迹层面的损失证据,自动诊断提供基于文本的梯度以指示修正方向,而一个动量智能体则将反复出现的诊断模式累积到持久记忆覆盖层中[3]。该方法在两个骨干大语言模型上平均比最强的基于训练的基线提升了6.7个百分点[3]。
另一个关键要素是治理层:它主动修复事实退化与结构臃肿,而非仅仅通过标量门控拒绝不合格的候选方案[1]。SkillEvo的治理层在退化累积时防止梯度漂移[1]。同样,技能覆盖率——一项用于检查技能中哪些部分被实际执行、以及智能体是否遵循指令的指标——为改进提供了细粒度的信号。当研究人员利用失败的约束标签来强化技能时,他们在五个智能体-模型组合上平均恢复了16.0%的失败任务[2]。这表明,确切知道哪条指令被违反,比仅仅知道任务失败更具可操作性。
关键在于:收益稀疏、依赖模型,且无法保证
尽管前景诱人,自我进化技能并不会随着每一轮迭代而稳步提升。一项涵盖五个基准测试和三种模型的受控评估发现,进化是稀疏的:在388个候选技能中,仅有55个确立了字节级不同的验证最优结果[5]。在14种设置中的11种里,基于验证的选择选出了进化技能,其中9种提升了发布测试的性能——但所有11种选择均来自包含失败轨迹的反馈条件[5]。这意味着失败至关重要;仅靠成功是不够的。
同一项研究发现,额外的测试时计算(如并行采样)有时能达到与进化技能相当的性能(在SearchQA上差距在0.43分以内),但在更困难的任务上则表现不佳(在SpreadsheetBench上落后30.96分)[5]。因此,持续的技能进化更应被理解为一种稀疏的、经验证过滤的搜索过程,其收益取决于模型和基准,而非必然的改进[5]。其他研究也印证了这一点:MemSkill通过学习和进化记忆技能,在四个基准上相较于强基线提升了任务性能,但其进化由对困难案例的定期回顾驱动,而非每次交互[6]。而Memento-Skills则表明,在不更新LLM参数的情况下实现持续学习是可能的,在两个基准上分别取得了26.2%和116.2%的相对提升,但这需要一种闭环的读写反思学习机制[4]。
关于这些资料来源
此回答基于6项研究(均为预印本)——发表于2026年,其中6项为2024年或之后——从9项通过质量筛选的研究中选出最具相关性的,这些研究源自从超过5亿篇论文数据库中检索到的60篇文献。
本文引用的文献
SkillEvo:来自多轮交互反馈的自我更新进化梯度
SkillEvo表明,多轮交互反馈能够产生持续的进化梯度,在六个云服务类别、九个生产技能及98个技能参考文件中,其表现分别优于基于单轮问答驱动的进化15.4个百分点,以及基于自我反思的进化23.0个百分点。
技能覆盖率:一种面向智能体技能的测试充分性度量指标
技能覆盖率作为一种基于轨迹的测试充分性指标,表明智能体轨迹平均仅覆盖技能行为约束的38.66%–45.51%,而利用失败约束标签强化技能,在五个智能体模型行中平均可恢复16.0%的失败任务。
SkillGrad:像梯度下降一样优化智能体技能
SkillGrad是一个受梯度下降启发的框架,利用轨迹级损失证据和基于文本的梯度来优化智能体技能,在SpreadsheetBench Verified和WikiTableQuestions上,相较于最强的基于训练的基线方法,在两个骨干大语言模型上平均提升了6.7个百分点。
Memento-Skills:让智能体设计智能体
Memento-Skills通过演化外部化技能与提示词,在不更新大语言模型参数的情况下实现持续学习,在通用AI助手基准测试和人类最后考试中分别取得了26.2%和116.2%的相对提升。
重新思考自我进化的智能体技能:多轮反馈动态
在五个基准测试和三个模型上的受控评估发现,技能演化是稀疏的(388个候选中仅有55个建立了字节级不同的验证最优结果),且所有11个基于验证的选择均来自包含失败轨迹的反馈条件;额外的测试时计算无法始终匹配演化出的技能。
MemSkill:面向自进化智能体的记忆技能学习与进化
MemSkill将记忆操作重新定义为可学习、可演化的记忆技能,在LoCoMo、LongMemEval、HotpotQA和ALFWorld上相较于强基线显著提升了任务表现,并且在不同场景下展现出良好的泛化能力。
