ERA:AI 科学家正式上岗?通过 LLM 进化实现专家级科学研究助理

An AI system to help scientists write expert-level empirical software

2026-01-01
Eser Aygün, Anastasiya Belyaeva, Gheorghe Comanici, Marc Coram, Hao Cui, Julie Jake Garrison, Renee Johnston, Anton Kast, Cory Y. McLean, Peter C. Norgaard, Zahra Shamsi, David Smalling, Julie James Thompson, Subhashini Venugopalan, Brian P. Williams, Chujun He, Sarah Martinson, Martyna Plomecka, Lai Wei, Yuchen Zhou, Qian-Ze Zhu, Matthew Abraham, Erica Brand, Anna Bulanova, Julie Jeffrey A. Cardille, Chris Co, Scott Ellsworth, Grace Joseph, Malcolm Kane, Ryan Krueger, Julie Johan Kartiwa, Daniel J. Liebling, Julie Jan-Matthis Lueckmann, Paul Raccuglia, Xuefei Wang, Xuefei Wang, Katherine Chou, James Manyika, Yossi Matias, John C. Platt, Lizzie Dorfman, Shibl Mourad, Michael P. Brenner
总结
问题
方法
结果
要点
摘要

本文推出了 Empirical Research Assistance (ERA),这是一个通过大语言模型 (LLM) 驱动树搜索 (Tree Search) 来自动编写专家级科学软件的 AI 系统。ERA 在单细胞生物学、流行病学和地理空间分析等多个 scorable 科学任务中,生成的代码性能均超越了人类专家和现有 SOTA 方法。

TL;DR

长期以来,编写高性能的科学软件(如单细胞分析工具或疫情预测模型)被认为是科学家的专属。由 Google DeepMind、Google Research、哈佛大学等机构联合发表的最新工作 ERA (Empirical Research Assistance) 打破了这一偏见。ERA 是一个结合了 LLM 语义变异树搜索 (Tree Search) 的系统,它不仅能写代码,还能阅读论文、吸收科研灵感并进行“思想杂交”。

在实际测试中,ERA 开发的软件在六大科学领域均达到了专家水平,甚至在单细胞测序集成等任务上刷新了人类数年研发积累的 SOTA 记录。

痛点深挖:为什么“写代码”成了科学发现的瓶颈?

传统的科学计算软件开发遵循“假设-实现-测试”的闭环。然而:

  1. 搜索受限:科学家往往由于时间精力有限,只测试几种直觉上的方案。
  2. 变异低效:传统的遗传编程(GP)依赖随机的代码变异,大多产生的都是无法运行的“垃圾代码”。
  3. 知识孤岛:由于领域壁垒,一个领域的优化技巧(如控制理论中的平滑)很难被迅速交叉应用到流行病学预测中。

ERA 的出现,旨在将这些耗时数月的“试错”过程缩短到几小时。

核心架构:LLM + 树搜索 (Methodology)

ERA 的核心逻辑在于将软件编写视为一个 Scorable Task(可评分任务)

1. 语义代码变异

与传统 GP 的随机增删改不同,ERA 使用 Gemini 2.5 Flash 作为变异算子。给它一段现有的代码和当前的测试分数,LLM 能够根据逻辑进行“有意义”的改进,例如更换一个正则化项或引入一种新的数据预处理手段。

2. PUCT 树搜索

为了避免陷入局部最优,ERA 采用了改进的 PUCT (Predictor + Upper Confidence bound applied to Trees) 算法。它在探索(Explore)和利用(Exploit)之间通过公式 (1) 平衡: 这使得系统在发现一个有潜力的方向(如某种特定的归一化方法)时能深入挖掘,同时还能保留回溯到其他分支的权利。

3. 核心机制:研究思想的“重组” (Recombination)

这是 ERA 最具“科研属性”的地方。它能接受来自外部论文的 PDF 摘要。比如,ERA 可以同时阅读关于 ComBat 方法和 BBKNN 方法的论文,并被指令执行:“融合这两种方法的优点”。事实上,最终多项任务的突破都源自这种 LLM 自发的“算法杂交”。

模型架构图 图 1: ERA 算法流程:输入问题与科研灵感 -> LLM 采样代码 -> 沙盒运行评分 -> 树搜索更新优选。


实验战绩:多领域的全面碾压

单细胞基因组学 (Genomics)

在单细胞 RNA 测序(scRNA-seq)集成任务中,ERA 基于科研思想重组得到的 BBKNN (TS) 方法,通过在 ComBat 矫正后的 PCA 空间内构建批次感知邻居图,比原始发表的最强算法还要高出 14%实验结果对比 图 2: ERA 生成的方法(蓝色)在多数指标上优于原始发表的基准方法(红色线)。

流行病预测 (Epidemiology)

在 COVID-19 住院人数预测任务中,ERA 的 Google Retrospective 模型直接超过了由 CDC 协调的、代表人类最高水平的 CovidHub Ensemble 集成模型。它发现:将经典的统计自回归模型与基于流行病学机理的模型进行“杂交”,预测精度(WIS 分数)最高。

时间序列基准 (GIFT-Eval)

在包含 28 个数据集的通用时间序列预测基准中,ERA 脱离所有沉重的深度学习框架,仅使用 Base Python 库就 hill-climbing 出了一套“分步式衰减组合库”,甚至击败了许多预训练的大型基础时间序列模型。

需替换为架构图 图 3: 时间序列预测任务中的突破图 (Breakthrough Plot),显示了代码变异带来的性能跃迁,例如引入季节性项和趋势平滑带来的分数骤增。


深度洞察与总结 (Critical Analysis)

为什么 ERA 有效?

ERA 的成功不只是因为 LLM 能写代码,更在于 Search-time Compute(推理时计算) 的规模效应。人类科学家可能尝试 5-10 个想法,而 ERA 可以在几天内尝试 1000-2000 个细微变异。在高维复杂的参数空间和算法空间中,ERA 能够识别出那些“大海捞针”般的协同优化策略。

局限性与挑战

  1. 评分依赖性:ERA 只能处理“可量化(Scorable)”的任务。如果科学问题无法给出明确的客观打分函数,搜索便失去了指南针。
  2. 计算资源:相比单词生成的单次调用,大规模树搜索需要昂贵的沙盒运行资源。

未来展望

ERA 的推出象征着 AI 对科学的贡献正在从“辅助润色论文”转向“实质性实验设计”。正如 AlphaGo 改变了围棋逻辑,ERA 及其代表的 LLM+Search 范式,正在把科学软件的迭代周期从“以年计”缩减为“以天计”。当 AI 开始学会从论文中提取灵魂并重组出超越人类的工具时,真正的“AI 高级助理”时代才算正式开启。

Takeaway: 如果你的科研流程中存在一个能清晰打分的测试环节,那么请做好准备,AI 的解决方案可能很快就会超过你的最优模型。

发现相似论文

试试这些示例

  • 查找最近其他采用大语言模型与进化搜索(Evolutionary Search)或树搜索结合来解决科学编程任务的 SOTA 论文。
  • 哪篇论文最早提出了 PUCT 算法,ERA 在采样机制上为了适应代码生成任务对其做了哪些具体的改进?
  • 有哪些研究将类似 ERA 的自动代码重构及 idea 重组方法应用到了强化学习(RL)策略优化或气象建模任务中?
目录
ERA:AI 科学家正式上岗?通过 LLM 进化实现专家级科学研究助理
1. TL;DR
2. 痛点深挖:为什么“写代码”成了科学发现的瓶颈?
3. 核心架构:LLM + 树搜索 (Methodology)
3.1. 1. 语义代码变异
3.2. 2. PUCT 树搜索
3.3. 3. 核心机制:研究思想的“重组” (Recombination)
4. 实验战绩:多领域的全面碾压
4.1. 单细胞基因组学 (Genomics)
4.2. 流行病预测 (Epidemiology)
4.3. 时间序列基准 (GIFT-Eval)
5. 深度洞察与总结 (Critical Analysis)
5.1. 为什么 ERA 有效?
5.2. 局限性与挑战
5.3. 未来展望