如今,AI编程代理在科学领域究竟能做什么?
在获得数据和代码的情况下,它们能够可靠地复现已发表的研究结果。在同类最大规模的系统评估中——涵盖四个社会科学学科的221项任务——Claude Code成功复现了大部分研究发现,其表现显著优于Codex [2]。两个智能体在一项推理任务中也表现出色,该任务要求仅根据论文的方法描述识别其背后的研究问题 [2]。这意味着科学家只需向智能体提供数据集和方法部分,就能获得一份与原始论文结论相符的可运行分析。
它们还能达到或超越人类在方法论上的多样性。在一项研究中,20次独立运行的Claude Code和Codex分析了移民与社会政策数据,结果Codex在方法多样性上与人类分析师持平,而Claude Code则生成了近三倍于人类的独特方法论规范[1]。这些智能体的效应估计结果与人类共识大体一致,且没有任何一个智能体模型与人类模型完全吻合——这意味着它们带来了真正新颖的分析视角,而非单纯的模仿[1]。
在科学软件开发中,智能体可以充当具备领域知识的协作者,而非通用的代码生成器。某大学研究软件工程中心经过二十多个月的实践,构建了一个名为LLMoxie的平台,将科学Python编程规范、领域知识及项目生命周期管理编码为插件系统[3]。这使得智能体从生成忽视科学库规范的代码,转变为产出可审计、可复现且尊重社区规范的软件[3]。
它们还有哪些不足?
端到端的自主研究仍遥不可及。在ResearchClawBench——一个涵盖10个科学领域、共40项任务(每项任务均基于真实已发表论文)的基准测试中,最强的自主智能体Claude Code平均得分仅为21.5分(满分100分),而测试中表现最佳的大语言模型得分为26.5分[4]。错误分析表明,失败主要集中在三个方面:实验方案不匹配、证据不匹配以及缺失科学核心[4]。通俗来说,智能体难以设计出符合论文意图的实验、难以正确解读证据,也难以把握核心科学问题。
他们易受解释偏差的影响,而非估计偏差。一项引人注目的发现表明,当研究人员向Claude Code提供明确的确认性提示——即指示其寻找支持某一特定观点的证据时,该智能体对该观点的支持率从10%骤升至90%,而其统计系数分布却基本保持不变[1]。这种偏差通过规则省略(即忽略一条本会与预期结论相矛盾的方法论规则)而非规则弱化来实现[1]。这意味着,同一智能体可以输出相同的数值,但根据提示如何引导其进行解释,却能讲述截然不同的故事。
在复杂系统设计与优化方面,它们表现不佳。在涵盖8个类别共20道编程题的ProjDevBench基准测试中,六款编程智能体的整体通过率仅为27.38%[6]。尽管它们能处理基础功能与数据结构,但在复杂系统架构设计、时间复杂度优化及资源管理方面仍存在困难[6]。就科学计算而言,这意味着智能体虽能编写简单的分析脚本,但尚无法构建复杂的模拟流程或优化高性能代码[6]。
存在哪些风险,科学家应如何应对?
风险远不止编码错误。一项2026年的分析指出了若干隐患:基于错误或有偏见的AI输出而制定的糟糕政策决策、当无人能解释AI如何得出结论时出现的责任真空、过度依赖自动化导致研究人员技能退化,以及AI生成的知识人类无法验证或理解[8]。作者认为,机构应培养研究人员的AI素养、偏见识别和输出验证能力,研究团队或许可以设立AI验证者或AI担保人角色,以监督AI辅助贡献的完整性[8]。
已有实用指南可用于降低这些风险。《人工智能辅助科学编程的十条简明规则》强调,在编程决策中保持人类主导权、建立可靠的验证流程、并保留领域专业知识[5]。核心要点包括:问题准备与理解、上下文与交互管理、测试与验证、以及迭代式代码质量保障[5]。其传达的信息十分明确:AI智能体是工具,而非科学判断的替代品。
记忆与溯源工具可提供助力。名为projectmem的本地优先、事件溯源记忆层,将开发过程记录为仅可追加的类型化事件日志——涵盖问题、尝试、修复、决策——并在智能体重复执行先前失败的修复或编辑已知脆弱文件前发出警告[7]。这使记忆转化为治理机制:它不仅回答智能体的提问,更对其下一步行动施加影响,而不可篡改的日志则为可复现、可审计的AI辅助开发提供了溯源轨迹[7]。此类工具对于强调可复现性与可审计性的科研工作至关重要。
关于这些来源
该答案基于8项研究(1篇经同行评审,7篇为预印本)——发表于2025年至2026年,其中8项来自2024年及以后——这些研究是从14项通过质量筛选的研究中选出的最相关成果,而14项研究又源自从超过5亿篇论文数据库中检索到的54篇文献。
本文引用的文献
社会科学中的AI编码智能体:方法多元、实证一致、解释脆弱
在20次针对移民与社会政策数据的独立执行中,Claude Code生成的方法规范数量几乎是人类分析师的三倍,但一个确认性提示使其结论从10%的支持率翻转至90%,而其系数分布并未改变——这表明偏差作用于解释层面,而非估算层面。
AI编码智能体能够复现社会科学研究成果
在涵盖四个社会科学学科的221项任务基准测试中,Claude Code复现了大部分研究结果,表现显著优于Codex;两个智能体在一项需要识别潜在研究问题的推理任务中也均表现出色。
LLMoxie:探索用于科学软件开发的智能体AI
在高校研究软件工程中心历经二十多个月的打磨,LLMoxie平台与RSE-Plugins生态系统将AI编程智能体从通用代码生成器转变为具备领域感知能力的协作伙伴——它们既能遵循科学Python规范,又能生成可追溯的代码来源记录。
ResearchClawBench:面向端到端自主科学研究的基准测试
在涵盖10个科学领域的40项任务基准测试中,最强自主智能体(Claude Code)平均得分为21.5分(满分100分),最佳大语言模型得分为26.5分;失败主要集中在实验方案不匹配、证据不匹配以及科学核心缺失等方面。
科学领域AI辅助编程的十条简单规则
在科学领域进行AI辅助编程的十条实用规则强调,需保持人类主导权、建立稳健的验证流程,并依托领域专业知识,以确保代码符合可靠性、可重复性和科学有效性的标准。
ProjDevBench:评估AI编程代理在端到端项目开发中的表现
在一项涵盖8个类别共20道编程题的基准测试中,六款编程智能体的整体通过率仅为27.38%。它们虽能处理基础功能,但在复杂系统设计、时间复杂度优化及资源管理方面仍存在明显不足。
PROJECTMEM:面向AI编程智能体的本地优先、事件溯源记忆与判断层
projectmem 是一个本地优先、基于事件溯源的记忆层,以仅追加日志的形式记录开发过程,并在代理重复执行已失败的修复操作前发出警告,从而为可复现的AI辅助开发提供记忆与治理双重功能。
使用AI代理进行研究的好处与风险
一项2026年的分析指出了AI智能体在研究中的风险,包括因偏见输出导致的政策决策失误、责任缺失、技能退化以及无法验证的知识;建议开展AI素养培训,并设立AI验证员角色。
