协同演进的工作流与技能究竟能带来什么?
核心思想是,智能体并非在每个任务上都从零开始,而是从自身成功的解题轨迹中学习。FlowEvo作为一个无需训练的框架,将成功轨迹编译为可复用的“技能记录”,将可执行代码与指导说明配对,并在未来任务中检索使用[2]。在交互式环境(ALFWorld)以及代码/数学生成任务(HumanEval、GSM8K)的测试中,FlowEvo在ALFWorld上取得了82.8%的成功率——比最强基线高出23.6个百分点——同时每轮平均使用的token数不到其一半[2]。这意味着它以远低于前者的计算成本解决了更多任务,直接降低了实际应用的门槛。
这种协同进化循环之所以有效,是因为它形成了一个反馈闭环:工作流生成技能,而技能又反过来优化未来的工作流。FlowEvo的三种机制——工作流到技能的编译、技能到工作流的反馈以及技能筛选——各自对整体收益有所贡献,这一点已通过受控消融实验得到验证[2]。其中,技能筛选环节至关重要:它会监控下游效用,并抑制引发负迁移的技能,从而防止智能体积累有害习惯[2]。
玄机何在?自我进化可能让智能体遗忘旧技能
最大的风险是“能力退化”——随着智能体适应新任务,它们可能会逐步丧失先前获得的能力。2026年的一项研究发现,这种情况在所有主要的进化通道中都会发生:工作流、技能、模型和记忆[5]。例如,在工作流进化中,针对GPT-5.1下的复杂任务进行优化,会使保留的简单任务性能降至41.8%[5]。这鲜明地提醒我们,学习新事物可能以牺牲旧知识为代价,而这对于任务多样化的实际部署场景而言,是一个严重的障碍。
同一项研究提出了一个解决方案:能力保持演化(CPE),这是一种在适应过程中约束破坏性能力漂移的稳定化原则。采用CPE后,保留的简单任务表现提升至52.8%,同时仍实现了更强的复杂任务适应能力[5]。这表明障碍不仅仅在于学习本身——而在于不遗忘的学习,这需要明确的保障机制。
我们怎么知道它真的有效?评估仍是一道坎。
即便有了协同进化,当前智能体在真实工作流中仍远未达到可靠水平。一个实时基准测试Claw-Eval-Live对13个前沿模型进行了评估,涵盖105项任务,涉及商业服务和本地工作区修复;表现最好的模型也仅通过了66.7%的任务,没有任何模型达到70% [1]。这表明,尽管协同进化能提升性能,但尚不足以让智能体在复杂、多系统工作流中实现足够可靠的自主使用。
该基准测试还指出,仅凭排行榜排名并不足以说明问题——通过率相近的模型在整体完成度上可能存在显著差异,而任务层面的区分度则集中在中间难度区间的任务上[1]。这意味着我们需要超越最终答案的评估方式,借助执行轨迹和审计日志来验证实际任务完成情况[1]。同样,在自主研究领域,2026年的一项研究发现,仅靠可执行的工作流并不能产生研究判断力;系统需要捕捉试错经验,并将其转化为行为改变[3]。他们的框架Sibyl-AutoResearch表明,这种转化是可行的,在回顾性审计中恢复了八个高置信度事件[3]。
协同进化在何时最有帮助,下一步又需要什么?
共同进化似乎在那些任务重复性足够高、能够从可复用技能中受益的领域最为有效,例如交互式环境和代码生成[2]。但在建筑、工程和施工(AEC)等高度碎片化的领域,障碍不仅仅在于技能——还在于基础设施。一篇2026年的论文指出,AEC需要“面向智能体的原生基础设施”,将语义知识、工具交互和策略约束下的工作流执行相结合,从而将碎片化的项目知识转化为可执行的资产[4]。这表明,仅靠共同进化无法克服系统性的碎片化问题;它还需要一个支持性的环境。
展望未来,证据指向三个优先事项:(1)建立防范能力退化的保障机制,正如CPE所展示的[5];(2)开发能够验证真实世界执行过程而非仅看最终答案的评估方法[1];(3)构建支持知识复用与治理的基础设施[4]。如果这些问题得到解决,协同演进的工作流程与技能确实有望降低先进AI智能体的使用门槛——但这将是一个渐进的过程,而非一蹴而就的解决方案。
关于这些来源
该回答基于5项研究(4项经同行评审,1项为预印本),发表于2026年,其中5项为2024年或之后的研究,从通过质量筛选的5项研究中选出最具相关性的内容,这些研究源自从超过5亿篇论文数据库中检索到的45篇文献。
本文引用的文献
Claw-Eval-Live:面向不断演化的真实世界工作流的实时智能体基准测试
Claw-Eval-Live是一个包含105项任务的实时基准测试,结果显示领先模型仅通过了66.7%的任务,且没有任何模型达到70%,这表明可靠的工作流自动化仍未得到解决,同时评估必须验证执行轨迹,而不仅仅是最终答案。
FlowEvo:通过工作流与可执行技能的协同进化实现智能体自我进化
FlowEvo是一个无需训练即可将成功轨迹编译为可复用技能记录的框架,在ALFWorld上实现了82.8%的成功率(比最强基线高出23.6个百分点),同时每集平均使用的token数不到其一半,这表明工作流与技能的协同进化能够提升准确性和效率。
Sibyl-AutoResearch:自主研究需要自我进化的试错机制,而非论文生成器
Sibyl-AutoResearch,一个自我演进的研究框架,表明仅靠可执行的工作流并不能产生研究判断力;它引入了试错机制,将试错信号转化为行为改变,并通过回顾性审计识别出八个高置信度的转化事件。
迈向AEC领域的智能体原生基础设施:从碎片化知识到可执行工作流
在AEC行业,一篇2026年的论文指出,下一个瓶颈并非数字工具本身,而是缺乏代理原生基础设施——这种基础设施将语义知识、工具交互与受策略约束的工作流执行相结合,从而将碎片化的项目知识转化为可执行的资产。
自我进化型智能体会遗忘吗?终身大语言模型智能体适应中的能力退化与保持
一项关于自我进化智能体的研究发现,对新任务的适应会在所有进化通道中逐步削弱先前获得的能力;采用能力保持进化(CPE)后,保留的简单任务性能从41.8%提升至52.8%,同时保持了适应性能。
