编码代理团队应如何调整工作流程,以负责任地使用更复杂的软件工程?

编码代理团队应采用分阶段自主性,在仓库文件中嵌入伦理规范,并保持人类监督,以负责任地使用人工智能。

直接答案

要负责任地使用更复杂的软件工程工具,编码代理团队应将AI代理视为具有明确自主权级别的自适应队友,而非完全自主的替代者。证据表明,顶尖代理在SWE-bench Lite上能解决多达43%的真实GitHub问题,但这种能力也带来风险:开发者已在AGENTS.md文件中编码伦理规则以约束代理行为[2],研究也建议采用工作周期来设定自主权级别[3]。关键在于将代理能力与结构化监督及明确的价值编码相结合,因为相关论文一致认为需要治理和人在回路控制[1][4]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

团队应如何决定何时让智能体自主行动?

第一步是不要再把AI智能体视为要么完全自主、要么完全受监督,而是让它们的自主程度与工作流程的各个阶段相匹配。关于人机协作团队的研究发现,工作周期——例如网络事件响应的各个阶段——可以根据该阶段任务的规范性和可预测性,来指导智能体的自主水平[3]。在实践中,这意味着智能体在常规代码生成时可能拥有高度自主权,但在合并或部署之前需要人工审批,尤其是在高风险环节。

这种分阶段推进的方法有证据支持,表明智能体已经具备足够能力,值得加以谨慎控制:顶尖智能体系统在SWE-bench Lite上能解决多达43%的真实GitHub问题,而在受控实验中,它们完成开发者任务的速度快55.8%[1]。这些数字既显示了真实的能力,也意味着如果缺乏护栏就贸然放开,会带来真实的风险。同一篇论文还指出了自主性与监督之间、基准测试表现与现实世界有效性之间尚未解决的张力[1]——因此,团队应将基准测试的胜利视为能力的信号,而非全面自动化的许可。

团队如何确保智能体遵循伦理与质量标准?

将责任付诸实践的一个实用方法,是将行为规则直接编码到仓库级别的上下文文件中,例如AGENTS.md。一份2026年的愿景文件发现,开发者已经在这些文件中嵌入关于公平性、可访问性、可持续性、语气和隐私的指导,从而有效构建了一个由开发者撰写的治理层,用以塑造智能体的行为[2]。这是一种具体的机制:与其依赖抽象的伦理原则,不如编写自然语言指令,让智能体在行动前先读取这些指令。

这种方法与负责任AI中多层次治理的广泛呼声相一致。一份关于负责任AI软件工程的路线图强调,应在多个层面建立治理机制,设置融入负责任实践的开发流程,并将“负责任AI设计”嵌入系统架构中[4]。通过将价值观写入代码库,团队正是在践行这一点——将高层原则转化为智能体可遵循的具体情境化指令。然而,该论文同时指出,我们尚不清楚智能体在多大程度上能可靠地遵守这些约束,因此团队应测试并监控合规情况,而非想当然地假设其合规[2]

这有什么陷阱——为什么团队不能直接让智能体全权接管?

关键在于,智能体尚未可靠到可以在无人监督的情况下运行,而其中的伦理风险又极高。那篇关于智能体工作流的概念性论文明确列出了尚未解决的矛盾:自主性与监督之间的张力、基准测试与现实世界有效性之间的张力,以及能力与伦理责任之间的张力[1]。同样,一项2023年关于AI驱动软件工程的研究指出,尽管AI采用呈上升趋势,但模型可解释性、伦理问题以及集成复杂性仍是重大挑战[5]。这些并非小问题——它们正是负责任的使用需要刻意调整工作流程的原因所在。

好消息是,团队可以适应变化。关于自适应自主代理的研究发现,动态的、类人的适应能力对于高效的人机协作团队至关重要,而利用工作周期来分配自主权级别,既能提升生产力,也能改善团队动态[3]。这意味着,团队应随着任务变化定期重新评估代理的自主程度,并在情况变得不那么可预测时,愿意适当降低其自主权。这些研究论文得出了共识:负责任的使用并非回避代理,而是设计工作流程,让人类始终参与其中,将价值观明确编码,并根据具体情境调整自主权[1][3][4]

关于这些来源

本回答基于5项同行评审研究——发表于2022年至2026年间,其中2项为2024年或之后发表,合计被引用153次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的44篇文献。

本文引用的文献

1

用于端到端软件工程自动化的智能体工作流

一篇关于智能体工作流的概念性论文报告称,顶级系统能解决SWE-bench Lite上高达43%的真实GitHub问题,在Human-Eval上达到85.9%的Pass@1,并以快55.8%的速度完成开发者任务,同时指出了自主性与监督、基准测试与现实世界有效性、能力与责任之间尚未解决的内在张力。

2

为AI智能体落实伦理规范:开发者如何将价值观编码进代码库上下文文件

基于初步调查的愿景论文发现,开发者正在将伦理价值观(公平性、可访问性、可持续性、语气、隐私)编码到诸如AGENTS.md之类的仓库级上下文文件中,作为开发者撰写的治理层,并呼吁对遵循情况与治理动态展开研究。

3

适应与克服:人类-AI协作中对自适应自主智能体的感知

一项针对网络事件响应团队的混合方法研究,涉及103名参与者和22次后续访谈,发现工作周期可根据任务的正式性和可预测性,为自适应AI代理分配自主级别,并且动态、类人的适应能力对于高效的人机协作团队至关重要。

4

制定软件工程负责任人工智能路线图

一篇路线图论文指出,负责任的人工智能挑战贯穿整个工程生命周期,并提出多层次治理、面向流程的开发实践以及负责任人工智能的设计架构风格,以将负责任的人工智能付诸实践。

5

AI驱动的软件工程

一项基于GitHub和Bitbucket数据及行业专家见解的研究发现,人工智能在软件开发中的整合呈现出令人鼓舞的上升趋势,但同时也指出模型可解释性、伦理问题及整合复杂性是重大挑战。