[ICML 2024] DISCOVERYBENCH:让 AI 成为科学家?揭秘 LLM 在自主数据分析中的能力边界
Discoverybench: Towards data-driven discovery with large language models
本文推出了 DISCOVERYBENCH,这是第一个专门用于评估大语言模型(LLM)自动化数据驱动科学发现能力的大规模基准测试。该基准涵盖了从社会学到生物学等 6 个领域的 264 个真实任务和 903 个合成任务,要求模型根据给定数据集自主进行假设搜索与验证。
TL;DR
如果给 AI 一个 Excel 表格和一个开放性的科学问题,它能像人类科学家一样得出严谨的结论吗?来自 Allen Institute for AI 的研究团队发布了 DISCOVERYBENCH,这是目前最硬核的“AI 科学家”成色检测器。实验结果令人冷静:即使是最强的 GPT-4o,在这些真实科研任务面前的及格率也只有 25%。
核心速览:LLM 距离“诺贝尔奖”还有多远?
将 AI 用于科学发现(Scientific Discovery)一直是学术界的终极梦想。虽然 LLM 在写代码和处理表格上表现出色,但真实的科学发现不仅仅是点击按钮跑个回归分析。它涉及到:
- 语义映射:将“社会经济地位”这种科研术语对齐到数据库里的
SES_Index_2023列。 - 长程规划:从清洗数据、缺失值处理到选择合适的非线性模型,这中间涉及几十步决策。
- 领域洞察:知道在考古学任务中,放射性碳定年数据该如何处理。
本文通过对已发表论文的“逆向工程”,构建了一个包含 1167 个任务的深度基准测试,旨在测试 LLM 是否具备真正的“科研直觉”。
痛点深挖:为什么现有的 Benchmark 都太简单了?
传统的 AutoML 或统计评估(如 QRData)往往提供清洗好的数据和明确的数学目标。然而,作者指出,真实的科研过程是非结构化且充满噪声的:
- 数据杂乱:原始数据需要复杂的 Join 和清洗。
- 目标模糊:科研目标通常是自然语言(如“城市土地利用如何影响入侵植物?”),而非现成的回归方程。
- 多步瓶颈:一旦其中一个统计环节出错,后续的理论推导将全部崩塌。
方法论详解:假设语义树 (Hypothesis Semantic Tree)
为了能够量化评估 AI 的表现,作者引入了一个优雅的数学工具——假设语义树。

在这个框架下,任何一个科研假设 都可以被形式化为 :
- (Context):边界条件(例:针对 30 岁以上的男性)。
- (Variables):涉及的核心变量(例:身高、体重、BMI)。
- (Relationship):变量间的逻辑关系(例:正相关、二次项关系)。
这种形式化的好处在于,评估不再是模棱两可的文本比对,而是可以针对三个维度精准打分(HMS 评分系统)。
实验结果:强如 GPT-4 也惨遭“滑铁卢”
研究者测试了 CodeGen (直接生代码)、ReAct (多轮思考)、以及 DataVoyager (专用代理) 等多种框架。

关键发现如下:
- 性能极低:在真实任务 (DB-REAL) 中,最高分仅 25%(在有 Oracle 反馈的情况下)。
- 工作流长度是“杀手”:当科研步骤超过 5 步时,模型的成功率呈断崖式下跌。
- 领域鸿沟:模型在经济学和社会学(通常涉及基础统计)表现尚可,但在生物学和工程学(涉及复杂公式和专用建模)上几乎全军覆没。
深度洞察:AI 科学家的下一步在哪里?
DISCOVERYBENCH 的结果揭示了一个残酷的现实:即便 LLM 读过成千上万篇论文,它依然难以在没有人类引导的情况下完成独立的科研闭环。
- 上下文是前提:实验显示,如果 AI 无法准确识别研究的 Context(适用人群或环境),它几乎不可能找对变量和关系。
- 工具调用的局限:目前的模型倾向于使用简单的线性相关计算。面对需要“逻辑链条”的复杂科学问题,AI 往往陷入局部细节而丢失了全局科学目标。
总结 (Takeaway)
这项工作不仅是一个数据集,更是一盆冷水,提醒我们:AI 辅助科研的难点不在于生成代码,而在于对科学逻辑的深度理解与长程调控。 能够真正像科学家一样思考的代理,可能需要结合更强大的因果推理能力和动态规划算法。
本文由资深学术技术主编重构。
