SDE:戳破通用 AI 的“全才”幻觉,大语言模型离真正的科研超智能还有多远?

Evaluating Large Language Models in Scientific Discovery

2025-01-01
Zhangde Song, Jieyu Lu, Yuanqi Du, Botao Yu, Thomas M. Pruyn, Yue Huang, Kehan Guo, Xiuzhe Luo, Yuanhao Qu, Yi Qu, Yinkai Wang, Haorui Wang, Jeff Guo, Jingru Gan, Parshin Shojaee, Di Luo, Andres M Bran, Gen Li, Qiyuan Zhao, Shao-Xiong Lennon Luo, Yuxuan Zhang, Xiang Zou, Wanru Zhao, Yifan F. Zhang, Wucheng Zhang, Shunan Zheng, Saiyang Zhang, Sartaaj Takrim Khan, Mahyar Rajabi-Kochi, Samantha Paradi-Maropakis, Tony Baltoiu, Fengyu Xie, Tianyang Chen, Kexin Huang, Weiliang Luo, Meijing Fang, Xin Yang, Lixue Cheng, Jiajun He, Soha Hassoun, Xiangliang Zhang, Wei Wang, Chandan K. Reddy, Chao Zhang, Zhiling Zheng, Mengdi Wang, Le Cong, Carla P. Gomes, Chang-Yu Hsieh, Aditya Nandy, Philippe Schwaller, Heather J. Kulik, Haojun Jia, Huan Sun, Seyed Mohamad Moosavi, Chenru Duan
总结
问题
方法
结果
要点
摘要

本文推出了 SDE (Scientific Discovery Evaluation) 框架,这是首个全面评估大语言模型(LLMs)在生物、化学、材料和物理四大领域科研发现能力的基准。该研究涵盖了从 43 个研究场景抽取的 1,125 个专家级问题以及 8 个闭环科研项目,揭示了当前顶级模型(如 gpt-5, deepseek-R1)在真实科研逻辑中相较于 SOTA 基准的性能差距。

TL;DR

如果把 LLM 比作一个学生,它可能在各科期末考试中拿了 A,但当把它扔进实验室面对一个全新的研发难题时,它可能连起码的假设都提不出来。由 Deep Principle 联合康奈尔、斯坦福等顶尖学府发布的 SDE (Scientific Discovery Evaluation) 评测框架显示:现有的顶级模型(gpt-5, deepseek-R1 等)在处理场景化的科学发现任务时,尽管推理能力有显著进步,但依旧无法在所有科研项目中胜任。

背景:知识不等于发现

目前的 AI 评测界陷入了一个误区:堆砌大量的研究生水平 Q&A。然而,正如论文所指出的:“能通过课程考试不代表能成为伟大的科学家”

现有的基准测试如 GPQA 高度“去语境化”,模型只需要关联知识点即可满分。但真实的科研是迭代的——你需要针对一个失败的模拟结果调整参数,需要从杂乱的 NMR 谱图中推理分子结构。为了填补这一空白,SDE 框架应运而生。

核心机制:情景驱动 (Scenario-grounded) 与 闭环发现

SDE 将评估分为两个维度:

  1. 模块化科研场景:包含 43 个细分场景(如 PXRD 晶体系统确定、CRISPR 输送策略等),确保问题与实际研发流程挂钩。
  2. 项目级闭环 (The Loop):这是论文最精彩的部分。它让模型担任“首席科学家”,通过进化算法进行假设提案,调用第三方模拟器(如 RDKit, VASP)获取反馈,并自主完成 8 个核心项目的优化。

模型架构与流程 SDE 框架流程:从模块化场景问答到闭环项目评估

深度洞察:科研里的 LLM 众生相

1. 推理能力的“双刃剑”

通过对 DeepSeek-R1(推理强化版)与 V3.1(非推理基座版)的对比,作者观察到了明显的推理红利。在物理、化学等严谨逻辑场景中,推理能力让准确率跃升。然而,这种提升在项目级优化中却出现了“高原反应”——随着推理步数的增加,模型可能在长程规划中因一个微小的 SMILES 语法错误而导致整个合成路径失败。

2. 惊人的“共犯现象”

研究发现,来自不同厂商的顶级 LLM 在面对高难度科研难题时(SDE-hard),倾向于犯完全相同的错误。这意味着目前所有主流模型可能受困于相似的预训练数据集分布,单纯的架构改进已进入瓶颈。

实验结果对比 图示:即使是 gpt-5 与 deepseek-R1,在某些特定的 MOF 合成问题上也高度共现了错误,预示了底层数据同源的隐患。

3. 科研中的“意外之喜” (Serendipity)

有趣的是,在过渡金属配合物(TMC)优化项目中,即便模型在预测氧化态这类基础问答中分数不高,但在寻找具有高极化率的新分子时却极其高效。这说明 LLM 具有一种某种程度上的**“群体统计直觉”**,即使细节报错,大方向却往往是对的。

实验战绩与 SOTA 对标

  • 生物学准确率:顶级模型最高可达 0.71,但相较于 MMMU-Pro 的 0.84+,科研语境下的性能损耗明显。
  • 符号回归 (Symbolic Regression):deepseek-R1 和 gpt-5 展现了卓越的收敛速度,能在大规模 OOD(分布外)数据中精准捕捉物理公式,远超传统方法 PySR。
  • 物化挑战:在伊辛模型 (Ising model) 的能量极小化搜索中,除了 deepseek-R1,多数模型竟然败给了传统的模拟退火算法。

局限性与未来展望

尽管 LLM 已经显露头角,但研究强调它们离真正的“科学超级智能”还有一段距离。主要短板在于:

  • 合规性检查:经常产生非法的化学 SMILES 符号。
  • 工具耦合不足:模型推理与专业仿真工具(如 LAMMPS)的集成还不够丝滑。
  • 长程规划:在多步逆合成路径规划中容易“断片”。

总结 (Takeaway)

科学发现不仅是关于“知道什么”,更是关于“如何探索未知”。SDE 的出现为这一领域设定了新的“北极星”,提醒开发者:未来的 AI 科学家,不应只是一个博学多才的考试机器,而应是一个能够忍受失败并从数据反馈中不断学习的、具备韧性的探索者。

发现相似论文

试试这些示例

  • 查找最近其他通过模拟“假设-实验-反馈”闭环来评估大语言模型科研能力的论文或评测框架。
  • 大语言模型在物质科学(材料、化学)发现中的推理缩放定律 (Scaling Laws for Reasoning) 是否存在与通用数学任务不同的性能饱和点?
  • 有哪些最新的研究在使用强化学习 (RL) 专门优化 LLMs 在蛋白质设计或逆合成路径规划中的多步决策能力?
目录
SDE:戳破通用 AI 的“全才”幻觉,大语言模型离真正的科研超智能还有多远?
1. TL;DR
2. 背景:知识不等于发现
3. 核心机制:情景驱动 (Scenario-grounded) 与 闭环发现
4. 深度洞察:科研里的 LLM 众生相
4.1. 1. 推理能力的“双刃剑”
4.2. 2. 惊人的“共犯现象”
4.3. 3. 科研中的“意外之喜” (Serendipity)
5. 实验战绩与 SOTA 对标
6. 局限性与未来展望
7. 总结 (Takeaway)