当SWE-bench Science中的假设不再成立时,编码智能体在科学工程任务中的鲁棒性如何?

SWE-bench Science的得分因数据泄露、测试薄弱和记忆效应而高估了真实编码智能体的能力;实际应用中的表现预计会低得多。

直接答案

编码智能体在SWE-bench Science上的表现看起来远比其在真实科学工程任务中的实际能力要强。该基准继承了SWE-bench的严重缺陷——高达32.67%的成功补丁可能依赖于问题文本中泄露的解决方案,而薄弱的测试可能错误地通过多达31%的补丁[1]。更糟糕的是,模型似乎会记忆SWE-bench任务,在类似的新任务上表现比在原始任务上差3到6倍[2][3]。当这些被过滤掉后,最佳智能体在原始基准上的成功率从12.47%降至3.97%[1],即使在SWE-bench Science上,顶尖智能体仍会失败超过一半的任务[4]。因此,对于真实的科学工程,实际可靠性远低于排行榜分数所暗示的水平。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么SWE-bench分数会高估真实的编程能力?

主要原因在于,SWE-bench及其变体并不能干净地衡量问题解决能力。2024年对SWE-bench的一项分析发现,顶级智能体(SWE-Agent + GPT-4)的成功补丁中,有32.67%涉及“解决方案泄漏”——答案实际上已经写在问题报告或评论中[1]。另有31.08%的通过补丁被标记为“可疑”,因为测试用例过于薄弱,无法验证正确性[1]。当这些有问题的案例被剔除后,该智能体的成功率从12.47%骤降至3.97%[1]。这意味着,相当一部分表面上的成功并非真正的工程能力。

第二个问题甚至更令人担忧,那就是记忆效应。两项独立的2025年研究发现,最先进的模型仅凭问题描述就能识别出有缺陷的文件路径——无需查看代码库——在SWE-bench-Verified上的准确率高达76%,但在来自基准测试之外代码库的任务上,准确率仅为53%[2][3]。同样,模型在SWE-bench-Verified上找到被修改文件的能力,比在BeetleBox和SWE-rebench等全新基准测试上高出3到6倍[3]。这一差距强烈表明,模型在训练过程中已经见过这些基准测试任务,因此它们是在回忆答案,而非从头推理[2][3]

科学工程任务带来了哪些额外挑战?

科学软件工程引入了通用编程基准无法涵盖的领域特定障碍。SWE-bench Science是2026年发布的一个基准,包含来自20个科学领域、98个代码库的119项任务,其结果显示,即使是最优秀的智能体(搭载Opus-5的Claude Code)也未能解决超过一半的任务(pass@1低于50%)[4]。作者指出了四种反复出现的失败模式:缺乏科学知识或抽象能力、探索方向错误或仅进行表面修复、修复覆盖不完整或系统集成不足,以及未能将科学知识推广到新案例[4]

有趣的是,加入科学指导并不总是有益的。同一研究中的配对消融实验表明,有充分依据的科学信息可以提升性能和令牌效率,但契合度不佳的指导反而可能有害——导致对错误想法产生“锚定效应”,且无法提高修复成功率[4]。这意味着,对于真实的科学任务,智能体既需要强大的编码能力,也需要准确的领域知识,而两者之间的相互作用十分微妙。

这些问题在SWE-bench Science中是独有的吗?

不——这些问题是系统性的,遍及整个SWE-bench系列。同样的数据质量问题(解决方案泄露、测试薄弱)在SWE-bench Lite和SWE-bench Verified中也被发现[1]。另一项2025年的研究使用自动化测试增强方法,发现原始SWE-bench中有345个错误补丁被错误标记为通过,影响了SWE-bench Lite排行榜上40.9%的条目和SWE-bench Verified排行榜上24.4%的条目[5]。这表明该基准的测试套件往往过于薄弱,无法区分正确的修复与表面性的修复。

这些基准测试同样存在静态和过时的问题。SWE-bench及其变体自发布以来从未更新,覆盖的代码库范围狭窄,且依赖人工筛选——这增加了过拟合和数据污染的风险[6]。较新的基准测试如SWE-bench-Live,使用2024年以来创建的GitHub问题,即使在受控条件下,其性能表现也与静态基准存在显著差距[6]。这表明智能体在处理全新的、未见过的任务时表现更差,而这正是如果它们记住了旧基准数据时你所能预期的结果。

关于这些来源

这个回答基于6项研究(1篇同行评审,5篇预印本)——发表于2024年至2026年间,其中6篇为2024年或之后发表——这些研究是从7项通过质量筛选的研究中选出的最相关者,而这7项研究又源自从超过5亿篇论文的数据库中检索到的23篇文献。

本文引用的文献

1

SWE-Bench+:面向大语言模型的增强型编码基准

对SWE-bench的人工分析发现,SWE-Agent+GPT-4生成的补丁中,32.67%的成功补丁存在解决方案泄露问题,31.08%因测试薄弱而存疑;过滤掉这些情况后,解决率从12.47%降至3.97%。

2

SWE-Bench幻觉:当最先进的LLM在记忆而非推理时

诊断任务显示,模型在SWE-bench-Verified上仅凭问题文本识别错误文件路径的准确率最高可达76%,但在非SWE-bench仓库上最高仅为53%,这表明存在记忆或数据污染现象。

3

SWE-Bench-Verified测试的是智能体的能力,还是模型的记忆?

Claude模型在SWE-bench-Verified上的表现比在BeetleBox和SWE-rebench上好3倍,在查找被编辑文件方面的表现则好6倍,这表明模型可能在训练过程中接触过SWE-bench-Verified的任务。

4

SWE-bench科学:编码智能体能解决科学领域的工程任务吗?

SWE-bench Science包含来自98个代码库、覆盖20个科学领域的119项任务,结果显示最佳智能体(Claude Code搭配Opus-5)的pass@1低于50%,并识别出四种失败机制,包括科学知识不足和表面性修复。

5

UTBoost:对SWE-Bench上编码代理的严格评估

UTBoost,一个自动化测试增强框架,在SWE-bench中识别出345个被错误标记为通过的缺陷补丁,影响了SWE-bench Lite排行榜中40.9%的条目以及SWE-bench Verified排行榜中24.4%的条目。

6

SWE-bench正式上线!

SWE-bench-Live包含1,319个任务,均来自2024年以来创建的GitHub问题,与静态基准相比,其性能差距显著,凸显了旧基准中过拟合和数据污染的风险。