ES在长时程任务中的信用分配表现如何?
公平评估首先要衡量的是信用分配——即训练方法如何确定哪些行为带来了奖励,尤其是在奖励稀疏且延迟的情况下。进化策略(ES)在这方面具有结构性优势:它在轨迹层面进行参数归因,而无需跨时间步分解奖励,随着时间跨度增长,其扩展性优于强化学习(RL)[3]。2025年的一项研究证明了这一点,该研究显示,在长时程和延迟奖励任务上,ES优于成熟的RL实现,同时在不同基础模型上更具鲁棒性,且更不易受到奖励黑客攻击的影响[5]。这意味着,公平评估应包含那些奖励仅在多步之后才出现的任务,并应在这些任务上将ES与RL进行对比,而不仅仅是在短时程任务上比较。
然而,ES并非万能灵药。一篇2026年关于记忆增强智能体的论文指出,当智能体跨会话写入、更新或删除记忆时,轨迹级比较会变得不公平,因为不同rollout不再共享相同的中间记忆状态[1]。这是一个关键警示:如果你的评估使用像GRPO(组相对策略优化)这样的群体相对方法,它可能会在长时程记忆操作中给出有偏的信用信号。因此,公平的评估必须包含记忆随时间变化的场景,并且必须检验训练方法能否在无偏的情况下处理这种变化。该论文提出了一种解决方案——结合局部与全局的组相对优化——但就评估而言,关键在于你需要将记忆密集型任务与简单的长时程任务分开测试。
训练后的智能体能否泛化到训练环境之外?
公正的评估必须追问:智能体学到的是可迁移的技能,还是仅仅记住了特定环境下的技巧。2026年的一项研究在27个类别的363个长时程任务上训练了一个模型,随后在五个外部基准上对其进行测试,结果发现相较于基础模型,性能提升了+2.8到+9.6个百分点——即使在训练数据中未包含的软件工程基准上也是如此[7]。这有力证明了经ES训练的智能体具备泛化能力,但同时也凸显出,评估必须在与训练任务模板和评分器完全无关的保留基准上进行。该研究通过成对轨迹分析,识别出四种反复出现的行为差异——例如更谨慎的目标设定和完成验证——这些差异跨领域迁移,表明评估应关注行为本身,而不仅仅是最终得分。
鲁棒性是公平评估必须包含的另一个维度。长时程智能体容易受到利用多轮交互的攻击,例如记忆投毒或目标漂移,而2026年的一项基准测试发现,即使是最先进的智能体仍然高度脆弱,单轮防御无法有效缓解这些威胁[6]。这意味着评估应包含对抗性场景,以检验ES训练是否使智能体变得更鲁棒或更脆弱。此外,2024年一项关于超长期对话记忆的研究发现,LLM在长程时间与因果动态方面存在困难,即使采用长上下文或检索增强生成,其表现仍落后于人类[4]。因此,公平评估应测试记忆一致性和时间推理能力,而不仅仅是任务完成度。
ES训练对大型模型和长时程任务是否实用?
公平的评估还必须衡量训练的实际成本。ES在可扩展性方面具有显著优势:它仅需推理级别的GPU内存即可实现全参数优化,从而能够微调那些在基于反向传播的RL技术栈下难以实际训练的大型模型[3]。2025年的一项研究证实了这一点,该研究展示了在不进行降维的情况下,ES微调可达到十亿参数规模[5]。这意味着评估应报告GPU内存占用和训练时间,而不仅仅是最终性能,因为一种方法即使得分略低,但若成本仅为其他方法的一小部分,可能更具实用性。
然而,ES有一个已知的弱点:样本复杂度高,尤其是在长时域任务中。2022年的一项研究通过使用辅助短片段任务将技能迁移到完整长度任务,从而减少了智能体与环境交互的数据需求[2]。这表明,公平的评估应衡量样本效率——即达到给定性能水平所需的环境交互次数——并应考虑该方法能否利用辅助任务加速学习。该研究的自适应资源分配策略还意味着,评估应追踪计算资源在辅助任务和主任务之间的使用情况,因为这会影响整体效率。
关于这些资料来源
本回答基于7项研究(2项同行评审,5项预印本),发表于2022年至2026年间,其中6项为2024年或之后发表,1项发表于Q1期刊。这些研究是从13项通过质量筛选的研究中选出的最相关者,而这13项研究又源自从超过5亿篇论文数据库中检索到的39篇文献。
本文引用的文献
Memory-R2:面向长时程记忆增强型LLM智能体的公平信用分配方法
Memory-R2引入了LoGo-GRPO,以解决记忆增强型大语言模型智能体中信用分配不公的问题,通过结合局部与全局组相对优化,改进记忆构建过程中的监督机制。
面向长、短回合强化学习的多任务神经进化
NuEMT将短片段辅助任务中的技能迁移至长时程强化学习任务,从而降低样本复杂度,并在连续控制任务上实现数据高效的进化强化学习。
Agentic ESOpt:以极低GPU需求微调长时程LLM智能体
Agentic ESOpt证明,进化策略(ES)能够以极低的GPU内存实现对大型语言模型的全参数微调,在WebArena-Lite上的性能相比无技能基线提升了6.69%。
评估LLM代理的超长期对话记忆能力
LoCoMo是一个包含超长期对话(最多32个会话、600轮)的数据集,研究表明,大语言模型在处理长程时间与因果动态方面存在困难,即便借助长上下文或RAG技术,其表现仍落后于人类水平。
大规模进化策略:超越强化学习的LLM微调
在十亿参数规模下,ES微调在长时程和延迟奖励任务上优于强化学习,表现出更强的鲁棒性并减少了奖励欺骗现象,且这一优势在多种基础大语言模型上均得到验证。
AgentLAB:在长时程攻击下对LLM智能体进行基准测试
AgentLAB基准测试包含28个环境中的644个安全测试用例,结果表明,LLM智能体对长时程攻击仍高度脆弱,而单轮防御无法有效缓解这些攻击。
长时程智能体中的跨基准泛化
在363个长时程MCP任务上进行后训练,使五个外部基准的性能提升了+2.8至+9.6个百分点,其中包括训练数据中未涉及的软件工程任务。
