AI 拉取请求真能减少缺陷并快速合并吗?
是的,在受控环境下,AI生成的拉取请求能够高效修复漏洞并获得较高的合并率。在彭博社,一款名为Pomona的轻量级智能工具在三个月内生成了39个拉取请求,其中32个(82.1%)被合并,中位关闭时间仅略超过两小时[2]。工程师们称赞其差异代码量小且注重代码质量,12名受访者中有10人表示希望采用该工具[2]。这表明,当AI代理被设计为生成小型、聚焦的修改时,它们能够在不给审查者带来过多负担的前提下,可靠地修复漏洞。
然而,从更大规模来看,情况更为复杂。一项针对1495个热门代码仓库中12433个AI生成拉取请求的大规模研究发现,随着时间的推移,被拒绝的概率逐渐下降,这意味着AI代理在生成可接受的PR方面表现越来越好[1]。文档的协同修改与较低的拒绝概率相关,而在有评论的拒绝案例中,功能故障——尤其是规格不匹配和逻辑缺陷——是最主要的可见拒绝模式[1]。因此,尽管AI能够减少错误,但在理解规格和逻辑方面仍存在困难,而这正是实现无缺陷代码的核心所在。
关于这些来源
该回答基于5项研究(4篇经同行评审,1篇为预印本)——发表于2026年,其中5篇来自2024年及以后,1篇发表于Q1–Q2期刊——这些研究是从通过质量筛选的5项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的46篇文献。
本文引用的文献
野外编码代理:AI生成拉取请求的失败模式与拒绝模式
一项针对来自1,495个代码仓库的12,433个AI生成拉取请求的研究显示,虽然被拒绝的概率随时间推移有所下降,但84.2%被拒绝的拉取请求在关闭时未收到审阅者的反馈,而功能故障(规格不匹配与逻辑缺陷)是主要的可见拒绝模式[1]。
Pomona:通过小型、自主拉取请求实现彭博社的持续代码质量改进
在彭博社,一款轻量级智能工具(Pomona)实现了82.1%的合并率(39个拉取请求中成功合并32个),中位关闭时间仅略超两小时,且接受调查的12名工程师中有10人希望采用该工具,称赞其差异规模小且注重代码质量[2]。
更多代码,更少复用:探究AI生成的拉取请求中的代码质量与审阅者态度
LLM智能体常常忽视代码复用的机会,导致其冗余程度高于人类开发者,而评审者对AI贡献持中性或正面情绪,这掩盖了技术债务的悄然积累[3]。
超越Bug修复:对智能体生成的拉取请求中合并后代码质量问题的实证研究
通过对1,210个合并的AI生成修复Bug的PR(拉取请求)进行SonarQube分析发现,代码异味在合并后的严重及主要等级质量问题中占主导地位,且合并成功并不能可靠反映合并后的代码质量[4]。
基于大语言模型的自动化代码审查:一种用于代码质量评估、重构建议及技术债务削减的混合框架
ARC-TD框架提出了一种基于大语言模型的混合代码审查系统,该系统结合了静态分析、依赖图推理与人工治理,将代码审查视为一个多目标优化问题,以实现持续的技术债务削减[5]。
