WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

AI编程代理是否具备足够的现实世界评估证据?

AI编码代理在特定任务(如MedDRA编码,速度提升48.7%)中展现出潜力,但在复杂的现实软件开发中表现不佳,合规性和正确性较低。

直接答案

关于AI编程智能体在真实场景中的表现,结论不一且高度依赖具体任务。在一项受控的临床数据管理研究中,AI智能体将编码时间缩短了48.7%,并在检测拼写错误时达到了85.1%的精确率[1]。然而,在开源软件开发中,AI智能体在58.4%的代码库中修改日志代码的频率低于人类,并且在67%的情况下未能遵循明确指令[2]。一项针对GitHub Copilot的研究发现,其Java建议的正确率仅为57%,而JavaScript更是低至27%[3]。因此,尽管AI智能体能在狭窄且定义明确的任务中提升效率,但在缺乏大量人工监督的情况下,它们尚不具备通用软件工程所需的可靠性和适应性。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

AI编程助手在真实场景中真的管用吗?

答案在很大程度上取决于具体任务。在一项范围明确、面向真实世界的临床数据管理任务中——即自动编码药物试验中的不良事件术语——一个AI智能体框架(结合大语言模型与检索增强生成技术)将平均编码时间缩短了48.7%,从每条记录8.0分钟降至3.9分钟,同时覆盖了95.8%的术语[1]。这充分体现了在重复性、规则导向的任务中效率的提升。但同一项研究也发现,与人类黄金标准相比,其精确度仅为70%,这意味着近三分之一的AI建议仍需人工修正[1]。因此,即便在最佳情况下,该智能体也只是效率提升工具,而非替代品。

在更广泛的软件工程领域,情况更为严峻。一项针对81个开源仓库中4550个AI生成的拉取请求的分析发现,在58.4%的仓库中,AI代理修改日志代码的频率低于人类;而当它们确实修改时,生成的日志往往需要人类修复——72.5%的生成后日志修复工作是由人类完成的[2]。这表明AI代理会遗漏日志记录等重要的非功能性需求,其输出仍需大量人工清理。

为何AI编程助手难以应对复杂软件任务?

一个关键原因在于,AI智能体无法遵循细微的指令。在日志记录研究中,明确要求规范记录的自然语言指令极为罕见(仅占拉取请求的4.7%),即便存在此类指令,智能体也有67%的情况未能遵守[2]。这表明存在一个根本性缺陷:当前AI智能体无法可靠地理解并执行开发者用自然语言表达的意图,尤其是在日志记录、错误处理或安全等非功能性需求方面。

另一个局限在于正确性。2022年一项针对GitHub Copilot的评估,使用33道LeetCode题目并涵盖四种编程语言,结果显示仅有57%的Java建议和27%的JavaScript建议通过了所有提供的测试[3]。另一项2023年的研究利用ChatGPT 3.5从头构建一款移动应用,结论是该工具仅能在一定复杂度范围内生成可运行的代码,且需要借助交互式、迭代的过程,配合越来越详细的提示词[4]。这表明,对于新颖或复杂的逻辑,AI代理仍需要大量的人工引导与验证。

这些工具在实际应用中的评估证据是否足以让人信赖?

尚未实现。尽管存在像CodeNet这样包含1400万份代码样本、覆盖55种编程语言的大型数据集可用于训练AI编程,但这些数据集是为基准测试而设计的,并非用于评估实际部署场景[5]。我们现有的实际应用研究范围十分有限:一项仅聚焦于肿瘤学试验数据及单一语言对[1],另一项关注开源项目中的日志记录行为[2],还有两项则局限于LeetCode题目或单一移动应用等狭窄的编码任务[3][4]。这些研究均未能在完整的、生产级软件开发生命周期中测试AI智能体——即涉及需求演变、团队协作或遗留代码集成的场景。

证据还表明,AI智能体生成的代码往往看似合理,实则存在细微错误——例如,依赖未定义的辅助方法,或生成本可简化的代码[3]。在没有针对多样化真实项目的大规模纵向研究之前,断言AI编程智能体已足够可靠、可在关键软件系统中无监督使用,仍为时过早。

关于这些来源

该回答基于5篇经同行评审的研究——发表于2021年至2026年间,其中2篇为2024年或之后发表,共被引用591次——这些研究是从通过质量筛选的5项研究中选出的最具相关性的成果,而该筛选过程则源于从涵盖超过5亿篇论文的数据库中检索到的76篇文献。

本文引用的文献

1

人工智能在MedDRA编码中的应用:从临床数据管理视角的实践探索

在一项利用药物试验不良事件数据的真实世界临床数据管理研究中,AI智能体框架将编码时间减少了48.7%,并在拼写检测中达到了85.1%的精确率,但相较于人类金标准的总体精确率仅为70%,这表明仍需大量人工审核。

2

AI编程代理的日志记录方式是否与人类相似?一项实证研究

一项针对81个开源仓库中4550个AI生成拉取请求的实证研究发现:在58.4%的仓库中,AI代理修改日志代码的频率低于人类;67%的情况下未能遵循明确的日志编写指令;而72.5%的日志修复工作由人类在AI生成代码后完成。

3

对GitHub Copilot代码建议的实证评估

一项针对GitHub Copilot的评估测试了33道LeetCode题目,涵盖四种编程语言,结果显示Java的代码建议正确率最高,达到57%,而JavaScript最低,仅为27%。此外,生成的代码有时会依赖未定义的辅助方法。

4

AI工具在移动应用自动代码生成方面的实证评估

一项使用ChatGPT 3.5从零生成Flutter移动应用的研究发现,该AI仅能在一定复杂度范围内生成可运行的代码,且需通过交互式过程不断细化提示词,才能获得可接受的结果。

5

CodeNet:面向多样化编程任务学习的大规模代码AI数据集

CodeNet数据集包含1400万个代码样本,涵盖55种编程语言,为训练AI执行代码分类与翻译等任务提供了大规模资源。然而,该数据集属于基准测试集,并非对已部署的AI编程代理进行真实场景评估。