ERA:深度科研助手突破,AI 自动编写专家级科学软件,性能超越 CDC 集成模型

s41586-026-10658-6_reference

总结
问题
方法
结果
要点
摘要

本文介绍了一种名为 ERA (Empirical Research Assistance) 的 AI 系统,旨在通过结合大语言模型 (LLM) 和树搜索 (Tree Search) 算法,自动编写、优化并生成专家级的科学实验软件。该系统在基因组学、流行病学和时间序列预测等多个复杂科学领域均达到了超越人类专家的 SOTA 水平。

TL;DR

Google DeepMind 团队近日在《Nature》预览版发表了重要成果。他们开发的 ERA (Empirical Research Assistance) 系统通过将 LLM 的生成能力与树搜索(Tree Search)的系统化探索相结合,能够自动编写原本需要领域专家耗时数月才能完成的复杂科学软件。

该系统不仅在 单细胞测序数据分析 中打破了人类纪录,还在 新冠疫情预测 等现实挑战中,生成的模型性能直接击败了 CDC(美国疾控中心)精心设计的专家集成系统。

核心挑战:科学软件开发的“迭代困局”

在许多科学领域,研究的核心往往在于设计能够最大化某种“质量分数”的经验软件(Empirical Software)。例如,为了预测蛋白质结构、模拟大气流动或分析复杂的基因组轨迹。

然而,现状却极度低效:

  • 开发周期长:构建一个健壮的实验代码库通常需要数年的领域积累。
  • 搜索空间受限:科学家往往基于直觉选择特定方法,难以穷尽所有可能的算法组合。
  • 转化能力弱:即便有优秀的前沿论文产出,将其思想复现并适配到具体任务中也是巨大的工程负担。

ERA 的出现,正是为了将这种“手动试错”转化为“自动化的全局搜索”。

核心机制:当 LLM 遇上树搜索(Tree Search)

ERA 的本质是一个在代码空间进行搜索的优化器。其核心流程如下:

  1. 代码变异 (Code Mutation):利用 LLM 作为“变异引擎”。不同于传统遗传算法的字符级随机扰动,LLM 可以在语义层面理解代码逻辑,根据外部输入的“研究建议”(如某篇 Nature 论文的摘要)直接重写算法逻辑。
  2. 树搜索 (Tree Search):采用类似 AlphaZero 的树搜索策略。系统利用 PUCT 公式 平衡“开发(Exploitation,优化当前得分最高的方案)”与“探索(Exploration,尝试全新的算法分支)”。这保证了 AI 不会陷入局部最优解。
  3. 思想重组 (Idea Recombination):这是 ERA 最具“创造力”的部分。它会分析多个成功的父代节点,提取两者的核心逻辑,自动融合成一个前所未见的混合模型。

ERA 算法流程与性能概览 上图展示了 ERA 如何从任务描述出发,结合研究建议,通过树搜索不断迭代并最终在 Kaggle 排行榜等任务中大幅超越基线。

实验战绩:全领域的降维打击

1. 基因组学:重塑单细胞单细胞整合排行

在单细胞 RNA 测序 (scRNA-seq) 任务中,目标是消除实验批次效应(Batch Effects)同时保留生物学多样性。ERA 基于已有的 9 种基础方法(如 BBKNN, ComBat 等),不仅复现了专家代码,还通过“重组”创造了 40 种新方法。

  • 结果:ERA 的方案在 OpenProblems 权威榜单上超越了所有人类开发的 SOTA。特别是 BBKNN (TS) 版本,通过将 ComBat 的校准逻辑与 BBKNN 结合,实现了 14% 的性能飞跃。

2. 流行病学:挑战 CDC 集成预测

在对美国 COVID-19 住院数据的预测中,ERA 表现出了极强的鲁棒性。

  • 战果:ERA 产生的 14 个预测策略优于 CDC 的官方 Ensemble 模型。
  • 发现:AI 自动选出的最优解通常是“混搭”:将稳定的传统统计模型(如 UMass-ar6_pooled)与灵活的流行病学模型(如基于再生数 R 的模型)结合。

COVID-19 预测性能对比 如图所示,ERA 生成的模型(Google Retrospective)在大多数州和时间维度上的误差(WIS)均低于专家集成基准。

3. 时间序列预测:通用库的自动演进

在 GIFT-Eval 测试中,ERA 不仅为每个数据集生成专项代码,还探索出了一个“通用预测库”。

  • 突破点:AI 自动在代码中加入了对节假日的处理逻辑(Holidays Library)和分段趋势拟合,这使得代码的泛化能力极强。

深度洞察:为什么 ERA 如此有效?

ERA 的成功不仅在于它“写得快”,更在于它具备学术翻译与跨界融合的能力:

  • 精准复现:传统的 LLM 往往难以精确实现复杂的数学推导,但 ERA 通过引入“质量分数”作为反馈闭环,能够强迫 LLM 在执行结果的指引下不断修正代码逻辑。
  • 非线性进化:从图中可以看到,ERA 的搜索过程中存在许多“跃迁(Breakthrough)”点。每一个跃迁点往往对应于 LLM 成功引入了一个关键的物理直觉或数学技巧。

代码迭代的突破路径图 突破曲线图清晰地记录了得分随树节点增加的变化。每一个绿色亮点都代表了一个代码重构带来的质变。

总结与未来展望

ERA 代表了 AI Agent 在科学领域从“对话式助理”向“工程化助手”的进化。它证明了在具有明确评估标准的任务中,AI 可以极大地降低复杂科学软件的准入门槛。

局限性:尽管 ERA 在经验建模上表现卓越,但它仍然依赖于预定义的“可评分任务(Scorable Task)”。对于需要从零推导理论框架或因果机制的“硬核发现”,ERA 目前主要扮演的是“执行者”和“优化者”的角色。

启示:未来的科学家可能不再需要精通每一行代码,他们的核心价值将转向:定义高质量的评估指标(Metrics)以及提供精准的领域构想(Ideas),而繁琐的实现与调优过程将交给像 ERA 这样的系统去自动完成。

发现相似论文

试试这些示例

  • 查找最近其他利用大语言模型与树搜索(如 AlphaZero 机制)结合进行自动化代码生成或算法发现的论文。
  • 哪篇论文最早探讨了利用进化计算进行自动化机器学习(AutoML)管道优化,本文的 LLM 迭代重写与之有何本质区别?
  • 有哪些最新的研究尝试将类似的科学发现智能体(SAI)应用到物理模拟或材料发现等具有物理约束的领域?
目录
ERA:深度科研助手突破,AI 自动编写专家级科学软件,性能超越 CDC 集成模型
1. TL;DR
2. 核心挑战:科学软件开发的“迭代困局”
3. 核心机制:当 LLM 遇上树搜索(Tree Search)
4. 实验战绩:全领域的降维打击
4.1. 1. 基因组学:重塑单细胞单细胞整合排行
4.2. 2. 流行病学:挑战 CDC 集成预测
4.3. 3. 时间序列预测:通用库的自动演进
5. 深度洞察:为什么 ERA 如此有效?
6. 总结与未来展望