用于科学工程任务的编码智能体,能否在长程多步任务中避免重复犯错?

用于科学任务的编码智能体可以通过记忆、自我反思和进化反馈来避免重复错误,但在长期任务中的可靠性仍存在差异。

直接答案

是的,但并非自动实现。现代编码智能体可以通过显式记忆、自我反思和迭代反馈循环,在长时间多步骤科学任务中避免重复犯错——例如,MOSAIC的学生-教师智能体逐步纠正错误,而AlphaEvolve的进化流水线则基于评估器反馈持续改进代码[2][3]。然而,可靠性取决于设计:像DeepSWE这样的基准测试表明,即使是前沿智能体在面对原创性、长周期任务时也会遇到困难,成功率可能差异很大[1]。在本研究涉及的各项工作中,最有力的证据指向多智能体或进化架构是防止重复错误的最有效方式,但没有任何方法能保证完美无缺。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

变化之处:智能体现在具备记忆与自我纠错机制

早期的编码智能体往往孤立地处理每一步,因此某一步的错误可能会悄然级联放大。而近期系统则明确构建了自我反思与错误修正循环。MOSAIC,一个面向科学编码的多智能体框架,采用师生范式,让智能体进行自我反思、生成推理、编写代码并调试——这种逐步分解与针对性错误修正直接解决了链式子问题中错误重复出现的问题[2]。类似地,AlphaEvolve采用进化式方法:它持续接收评估者的反馈,并通过直接修改代码来迭代改进算法,这意味着错误不仅被修复,还能在后续迭代中防止其再次发生[3]

关键的转变是从一次性生成转向迭代优化。Aviary——一个面向语言智能体的训练环境——将科学任务形式化为行动与观察的循环,并表明通过在线训练和扩展推理时的计算量,即使是开源模型也能在DNA克隆和蛋白质工程等多步骤任务上媲美甚至超越前沿大语言模型和人类专家[4]。这表明,避免重复错误的能力不仅取决于模型规模,更在于将反馈回路嵌入智能体的工作流程中。

这些机制有效的证据:从任务调度到矩阵乘法

最引人注目的成功来自进化式和多智能体设计。AlphaEvolve被应用于实际计算问题,为数据中心找到了更高效的调度算法,简化了硬件电路设计,甚至发现了一种用48次标量乘法计算4x4复数矩阵乘法的新算法——这是56年来对Strassen算法的首次改进[3]。这表明,迭代反馈不仅能避免过去的错误,还能超越人类设计的解决方案。

MOSAIC在科学编码基准测试中的准确性、鲁棒性和可解释性方面均优于现有方法,这尤其得益于其设计能够缓解大语言模型在解决包含链式子问题的复杂任务时产生的幻觉现象[2]。HyperAgent作为一个模拟人类开发者工作流程的通用多智能体系统,同样在GitHub问题解决(SWE-Bench)和仓库级代码生成方面树立了新的基准,表明结构化的多智能体流水线能够处理长周期任务而不会重复出错[6]

症结所在:长周期任务仍暴露短板,尤其在全新或复合场景中

尽管取得了这些进展,相关证据仍喜忧参半。DeepSWE基准测试包含113项原创、长周期工程任务,结果显示,前沿智能体在排行榜上表现集中,但当任务真正新颖且未受预训练数据污染时,它们的得分差距会拉大,分布在一个更宽的分数区间内[1]。这意味着,即使是最优秀的智能体,在面对需要真正解决问题而非简单回忆的任务时,仍可能失败。

另一个局限出现在机器人科学实验中:针对原子任务微调的视觉-语言-动作(VLA)模型,在被要求将这些任务组合成更长的流程时往往失败,因为它们缺少过渡步骤。一个基于LLM的推理插件在推理过程中将每个原子任务的平均成功率提高了42%,但这是一种干预手段,而非内置能力[5]。因此,尽管智能体可以被教会避免错误,但在新颖组合上的泛化能力仍然是一个需要显式设计的挑战。

关于这些资料来源

该回答基于6项研究(均为预印本)——发表于2024年至2026年间,其中6项为2024年或之后发表——这些研究是从6项通过质量筛选的研究中选出的最相关者,而这些研究又源自从超过5亿篇论文的数据库中检索到的36篇文献。

本文引用的文献

1

DeepSWE:在原创、长周期工程任务上评估前沿编码智能体

DeepSWE基准测试包含113个原始、长周期任务,结果显示前沿智能体在该基准上的得分跨度比在受污染基准上更宽,这表明在真正新颖的任务上避免错误仍然十分困难。

2

MOSAIC:面向任务智能科学编码的多智能体编排

MOSAIC是一个具有自我反思和学生-教师调试功能的多智能体框架,在科学编码基准测试中优于现有方法,显著提升了准确性、鲁棒性和可解释性。

3

AlphaEvolve:面向科学与算法发现的编码智能体

AlphaEvolve,一个进化式编码智能体,通过评估器反馈迭代改进代码,并取得了突破性成果,例如为4x4复数矩阵设计出48次标量乘法的算法,这是56年来对Strassen算法的首次改进。

4

Aviary:在具有挑战性的科学任务上训练语言智能体

Aviary是一个面向语言智能体的训练环境,研究表明,通过在线训练和扩展推理时计算,开源模型在多步骤科学任务上能够达到甚至超越前沿大语言模型和人类专家,而成本最高可降低100倍。

5

Sci-VLA:面向科学实验中长时程任务的智能体VLA推理插件

Sci-VLA作为一种基于LLM的推理插件,通过生成过渡动作,在长时程机器人科学实验中使每个原子任务的平均成功率提升了42%,但仍需外部干预。

6

HyperAgent:通用型软件工程智能体,用于大规模解决编码任务

HyperAgent是一个通用型多智能体系统,包含规划器、导航器、编辑器和执行器四种智能体,在SWE-Bench、RepoExec和Defects4J基准测试上创下新纪录,展现出对长周期任务的高效处理能力。