未来两年,更严格的软件工程将如何改变软件工程智能体?

更难的基准测试和训练方法将推动软件工程智能体从玩具级修复迈向真实世界中的多文件任务——这将带来巨大收益,但也伴随着新的监督需求。

直接答案

未来两年,软件工程智能体将在真实、复杂、多文件的任务上取得显著进步——而不仅仅是玩具级的编程问题——这得益于更难的基准测试和新的训练方法。例如,一个训练框架将开源模型在标准基准上的成功率从9.4%提升到了22.4%,另一个利用测试时计算的智能体在同一基准上达到了46%,超越了比它大20倍的模型。但证据也表明,即使是最优秀的智能体,在大多数现实世界的问题上仍然会失败,而人类的监督——审查、规划和测试——依然不可或缺。因此,可以预期智能体会变得更强大、更自主,但不会完全放手不管。

9篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

更严苛的基准测试才是智能体进步的真正驱动力

推动软件工程智能体发展的最大动力,是那些反映真实、长期工作而非孤立编程难题的基准测试的到来。2025年推出的SWE-Bench Pro包含来自41个活跃维护仓库的1,865个问题,其中任务可能需要专业工程师花费数小时到数天才能完成,且常常需要跨多个文件进行补丁修改[9]。这与早期更简单、更容易被钻空子的基准测试形成了鲜明对比。作者明确将其设计为抗污染且能捕捉企业级复杂度的基准,这意味着智能体不能再依赖记忆的代码片段或单文件修复。

这一转变之所以重要,是因为它改变了“优秀”的定义。在较早的SWE-bench Lite基准上,一种简单的无代理方法(Agentless)仅通过定位、修复和验证补丁,无需任何复杂工具调用,就达到了32%的准确率——这在当时是所有开源代理中最高的[2]。但在难度更高的SWE-Bench Pro上,即使是最优秀的代理在大多数任务上也会失败,作者对失败模式进行了聚类分析,结果表明当前模型在长程推理和多文件修改方面存在明显不足[9]。因此,门槛正在提高,那些在简单任务上表现亮眼的代理,如今正暴露出其在实际软件工程中的局限性。

训练方法正在迎头赶上:更好的奖励与引导

最大的瓶颈之一,一直是在奖励稀疏的复杂环境中训练智能体——智能体可能要执行数十步之后,才能知道自己的补丁是否有效。2025年提出的一个名为Agent-RLVR的框架,通过在训练过程中加入“智能体引导”——比如高层计划和错误反馈等提示——来解决这一问题,随后利用可验证奖励的强化学习(RLVR)来更新策略。结果是:在SWE-bench Verified基准上,它将Qwen-2.5-72B-Instruct的pass@1(首次尝试即修复问题的概率)从9.4%提升到了22.4%,而当引导数据也用于训练奖励模型时,这一数字进一步升至27.8%[1]。这仅凭一次训练改动就带来了3倍的提升,表明更智能的训练信号可以在不扩大模型规模的情况下释放能力。

另一种方法是SWE-Dev,它通过合成测试用例和智能体轨迹来扩大训练数据规模。其7B和32B模型在SWE-bench Verified上分别取得了23.4%和36.6%的成功率,超越了当时其他开源智能体[4]。第三种方法来自阿里巴巴,侧重于扩展测试时计算——让模型“思考更久”,而不是把模型做得更大。他们的32B模型在SWE-bench Verified上达到了46%的成绩,击败了规模大20倍的DeepSeek R1 671B和OpenAI o1[5]。这些方法的共同点在于:它们都是训练或推理策略,旨在更充分地利用现有模型能力,而非单纯追求更大的模型。

关键在于:智能体仍需人类与结构化流程

尽管取得了这些进展,但证据明确表明,智能体尚未准备好实现无人监督的工作。一项2026年对17位资深开发者的访谈研究发现,监督是成功的人机协作核心——开发者会进行事前控制、共同规划、实时监控和事后审查,而他们在审查智能体生成的代码时面临困难,常常将测试结果作为正确性的替代指标[7]。这并非细枝末节,而是智能体在实际应用中的根本性组成部分。

技术论文也印证了这一点。在Linux内核上,2025年的一项研究发现,最先进的智能体在文件级故障定位方面仅达到41.6%的top-1准确率——这意味着它们往往连正确的文件都找不到,更别提修复bug了[3]。此外,尽管像AgileCoder这样的多智能体系统(它模仿敏捷方法论,设有产品经理和测试员等角色)在代码生成基准测试上优于ChatDev和MetaGPT等早期系统,但它们仍然依赖结构化的工作流程和动态代码图来管理复杂性[8]。即便是通过bandit优化(BOAD)自动发现的最佳分层智能体设计,在SWE-bench-Live上也仅以36B模型排名第二,虽然超越了更大的模型,但仍未能解决大多数问题[6]。因此,现实中的近期图景是:智能体在特定子任务上表现越来越好,但人类仍将参与其中,而最有效的系统将是那些施加结构约束的系统——无论是通过角色、图还是引导——而不是让智能体自由发挥。

关于这些资料来源

本回答基于9项同行评审研究——发表于2025年至2026年,其中9项为2024年或之后发表,合计被引用330次——这些研究是从10项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的47篇文献。

本文引用的文献

1

Agent-RLVR:通过引导与环境奖励训练软件工程智能体

Agent-RLVR是一个利用引导和环境奖励的训练框架,它将Qwen-2.5-72B-Instruct在SWE-bench Verified上的pass@1从9.4%提升至22.4%,在与奖励模型训练结合时进一步提升至27.8%。

2

揭开基于大语言模型的软件工程智能体的神秘面纱

Agentless,一种简单的三阶段无代理方法,在SWE-bench Lite上达到了32.00%的准确率,是当时开源软件代理中最高的,并被OpenAI和DeepSeek采用用于评估。

3

驯服系统复杂性:揭秘软件工程智能体在诊断Linux内核故障中的应用

在新的Linux内核故障定位基准测试(LinuxFLBench)上,最先进的LLM智能体在文件级别仅达到41.6%的top-1准确率;一个增强框架(LinuxFL+)以极低的成本将准确率提升了7.2%–11.2%。

4

SWE-Dev:通过训练与推理扩展构建软件工程智能体

SWE-Dev基于合成测试用例和规模化智能体轨迹构建,在SWE-bench Verified上取得了23.4%(7B)和36.6%(32B)的成功率,超越了其他开源智能体。

5

思考更久,而非更大:通过扩展测试时计算来增强软件工程智能体

统一的测试时计算扩展框架使一个32B模型在SWE-bench Verified上实现了46%的问题解决率,超越了DeepSeek R1 671B和OpenAI o1等更大的模型。

6

BOAD:通过Bandit优化发现分层软件工程智能体

BOAD,一种用于发现分层多智能体设计的强盗优化方法,在SWE-bench-Verified上超越了单智能体和人工设计的多智能体系统,并在SWE-bench-Live上以36B系统排名第二,超过了GPT-4和Claude等更大规模的模型。

7

实践中人类对智能体系统的监督:审视开发者使用软件代理时的监督工作、挑战与启发式方法

对17位经验丰富的开发者的访谈揭示了四种涌现式监督工作形式(先验控制、协同规划、实时监控、事后审查),以及诸如难以审查智能体生成的代码等挑战,并提出了诸如将测试结果作为保障等启发式方法。

8

AgileCoder:基于敏捷方法的动态协作智能体软件开发框架

AgileCoder是一个基于敏捷方法论并配备动态代码图生成器的多智能体系统,在代码生成基准测试(HumanEval、MBPP)及真实场景中均优于ChatDev和MetaGPT。

9

SWE-Bench Pro:AI智能体能否解决长时程软件工程任务?

SWE-Bench Pro是一个新基准,包含来自41个代码库的1,865个长时程问题,结果表明当前智能体在大多数任务上表现不佳,失败模式集中凸显了其在长时程推理和多文件修改方面的局限性。