NatureBench在揭示受自然启发的科学智能体方面,可能遗漏了什么?

NatureBench在真实Nature论文上测试编码智能体,但其严格的设置和对代码的侧重忽略了科学发现的关键方面。

直接答案

NatureBench能告诉你一个AI编程代理在把已发表的科学方法转化为可用代码方面表现如何,但它无法告诉你该代理是否具备真正的科学发现能力。在该基准测试自身的结果中,表现最好的代理仅在17.8%的任务上超越了已发表的最先进水平,而且其成功大多来自将问题转化为熟悉的预测任务,而非发明新科学[1]。因此,该基准测试揭示的是编码能力,而非科学创造力——并且它刻意剥离了真实发现所需的开放式、探索性背景[2]

3篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

NatureBench 实际衡量的是什么——以及它遗漏了什么

NatureBench是一个包含90个任务的基准测试,这些任务源自真实的Nature系列论文,旨在检验AI编程代理能否复现科学论文中已发表的结果[1]。这是一项对代码级复现的严格测试:每个任务都被封装在容器化环境中,代理在禁用网络搜索的严格协议下接受评估[1]。这保证了可复现性,但也意味着该基准衡量的是代理遵循既定方案的能力,而非其创新方案的能力。

关键的局限在于,NatureBench的任务本身已从已发表的论文中提炼而来——科学问题、方法和预期结果都已预先设定。正如2025年一篇关于智能体科学的评论文章所述,真正的发现涉及推理、规划,并以开放式方式与数字和物理环境互动[2]。NatureBench剥离了这种开放性,因此它无法揭示智能体能否提出新颖假设、从零开始设计实验,或识别出结果是否出人意料。它只能表明智能体能否正确执行已知方法。

最佳情形与典型情形表现之间的差距

NatureBench给出的首要数字令人警醒:在十种前沿智能体配置中,最强模型仅在17.8%的任务上超越了已发表的最先进成果(采用g>0.1的阈值,即智能体的结果至少比已发表的基线好10%)[1]。通俗地说,即使是最优秀的AI智能体,在超过五分之四的任务上也未能击败原论文的结果。这鲜明地提醒我们,当前的编程智能体远未达到人类科学专业水平的匹配程度。

但该基准测试也揭示出,失败并非源于对任务的理解偏差——而是选择了错误的方法,且计算预算不足[1]。这是一个重要的细微差别:智能体明白要求是什么,但往往采用了较劣的方案,或耗尽了计算资源。这表明,智能体科学领域的进展可能更多来自改进方法选择和扩展计算规模,而非提升语言理解能力。然而,这也意味着该基准测试的结果与所测试的具体计算预算和模型配置密切相关——不同的设置可能会得出不同的数字。

超越代码:科学创新真正需要什么

NatureBench自身的分析表明,智能体主要通过“方法论转译”——将科学任务转化为熟悉的监督预测问题——来取得成功,而非通过真正的科学发明[1]。这是一个关键的洞见:该基准测试能够揭示智能体改编已知方法的能力,却无法揭示其能否产生根本性的新科学思想。作者们将这一基准定位为迈向“发现”的一步,但结果表明,当前的智能体仍处于复现与转译阶段。

真正的科学发现,正如仿生纳米酶领域所展现的那样,往往需要将某一领域的原理迁移到另一领域——例如,将天然酶的催化机制嫁接到合成纳米材料的设计中[3]。这种跨领域的洞察力并非编码基准测试所能轻易捕捉的,因为它涉及概念上的飞跃,而不仅仅是代码执行。NatureBench可以判断一个智能体能否实现已知方法,却无法判断它能否做出那种催生新材料类别或新理论的创造性跳跃。因此,尽管NatureBench是评估编码智能体的宝贵工具,它应被视为衡量技术熟练度的标准,而非科学创造力的标尺。

关于这些来源

这个回答基于3项研究(2项经同行评审,1项为预印本),发表于2021年至2026年间,其中2项为2024年或之后发表,2项发表于Q1期刊,合计被引用667次。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的31篇文献。

本文引用的文献

1

NatureBench:编码智能体能达到Nature系列论文已发表的最先进水平吗?

NatureBench是一个包含90项来自Nature系列论文任务的基准测试,结果显示,最强的AI编程智能体仅在17.8%的任务上超越了已发表的最先进水平(g>0.1),失败的主要原因在于方法选择错误和计算资源不足,而非对任务的理解有误。

2

迈向智能体科学,以推动科学发现的进步

一篇2025年关于智能体科学的评论文章指出,用于科学发现的AI智能体必须具备推理、规划以及与数字和物理环境互动的能力,并强调真实科研工作的开放性特征,这类特征可能是NatureBench等基准测试无法完全涵盖的。

3

受天然酶启发的纳米酶

2021年一篇关于仿生纳米酶的综述表明,高活性酶模拟物是通过将天然酶的催化原理引入纳米材料设计而制备的,这体现了跨领域的概念创新,而这类创新是编程基准测试无法衡量的。