ERA:AI 科学家正式上岗?通过 LLM 进化实现专家级科学研究助理
An AI system to help scientists write expert-level empirical software
本文推出了 Empirical Research Assistance (ERA),这是一个通过大语言模型 (LLM) 驱动树搜索 (Tree Search) 来自动编写专家级科学软件的 AI 系统。ERA 在单细胞生物学、流行病学和地理空间分析等多个 scorable 科学任务中,生成的代码性能均超越了人类专家和现有 SOTA 方法。
TL;DR
长期以来,编写高性能的科学软件(如单细胞分析工具或疫情预测模型)被认为是科学家的专属。由 Google DeepMind、Google Research、哈佛大学等机构联合发表的最新工作 ERA (Empirical Research Assistance) 打破了这一偏见。ERA 是一个结合了 LLM 语义变异与树搜索 (Tree Search) 的系统,它不仅能写代码,还能阅读论文、吸收科研灵感并进行“思想杂交”。
在实际测试中,ERA 开发的软件在六大科学领域均达到了专家水平,甚至在单细胞测序集成等任务上刷新了人类数年研发积累的 SOTA 记录。
痛点深挖:为什么“写代码”成了科学发现的瓶颈?
传统的科学计算软件开发遵循“假设-实现-测试”的闭环。然而:
- 搜索受限:科学家往往由于时间精力有限,只测试几种直觉上的方案。
- 变异低效:传统的遗传编程(GP)依赖随机的代码变异,大多产生的都是无法运行的“垃圾代码”。
- 知识孤岛:由于领域壁垒,一个领域的优化技巧(如控制理论中的平滑)很难被迅速交叉应用到流行病学预测中。
ERA 的出现,旨在将这些耗时数月的“试错”过程缩短到几小时。
核心架构:LLM + 树搜索 (Methodology)
ERA 的核心逻辑在于将软件编写视为一个 Scorable Task(可评分任务)。
1. 语义代码变异
与传统 GP 的随机增删改不同,ERA 使用 Gemini 2.5 Flash 作为变异算子。给它一段现有的代码和当前的测试分数,LLM 能够根据逻辑进行“有意义”的改进,例如更换一个正则化项或引入一种新的数据预处理手段。
2. PUCT 树搜索
为了避免陷入局部最优,ERA 采用了改进的 PUCT (Predictor + Upper Confidence bound applied to Trees) 算法。它在探索(Explore)和利用(Exploit)之间通过公式 (1) 平衡: 这使得系统在发现一个有潜力的方向(如某种特定的归一化方法)时能深入挖掘,同时还能保留回溯到其他分支的权利。
3. 核心机制:研究思想的“重组” (Recombination)
这是 ERA 最具“科研属性”的地方。它能接受来自外部论文的 PDF 摘要。比如,ERA 可以同时阅读关于 ComBat 方法和 BBKNN 方法的论文,并被指令执行:“融合这两种方法的优点”。事实上,最终多项任务的突破都源自这种 LLM 自发的“算法杂交”。
图 1: ERA 算法流程:输入问题与科研灵感 -> LLM 采样代码 -> 沙盒运行评分 -> 树搜索更新优选。
实验战绩:多领域的全面碾压
单细胞基因组学 (Genomics)
在单细胞 RNA 测序(scRNA-seq)集成任务中,ERA 基于科研思想重组得到的 BBKNN (TS) 方法,通过在 ComBat 矫正后的 PCA 空间内构建批次感知邻居图,比原始发表的最强算法还要高出 14%。
图 2: ERA 生成的方法(蓝色)在多数指标上优于原始发表的基准方法(红色线)。
流行病预测 (Epidemiology)
在 COVID-19 住院人数预测任务中,ERA 的 Google Retrospective 模型直接超过了由 CDC 协调的、代表人类最高水平的 CovidHub Ensemble 集成模型。它发现:将经典的统计自回归模型与基于流行病学机理的模型进行“杂交”,预测精度(WIS 分数)最高。
时间序列基准 (GIFT-Eval)
在包含 28 个数据集的通用时间序列预测基准中,ERA 脱离所有沉重的深度学习框架,仅使用 Base Python 库就 hill-climbing 出了一套“分步式衰减组合库”,甚至击败了许多预训练的大型基础时间序列模型。
图 3: 时间序列预测任务中的突破图 (Breakthrough Plot),显示了代码变异带来的性能跃迁,例如引入季节性项和趋势平滑带来的分数骤增。
深度洞察与总结 (Critical Analysis)
为什么 ERA 有效?
ERA 的成功不只是因为 LLM 能写代码,更在于 Search-time Compute(推理时计算) 的规模效应。人类科学家可能尝试 5-10 个想法,而 ERA 可以在几天内尝试 1000-2000 个细微变异。在高维复杂的参数空间和算法空间中,ERA 能够识别出那些“大海捞针”般的协同优化策略。
局限性与挑战
- 评分依赖性:ERA 只能处理“可量化(Scorable)”的任务。如果科学问题无法给出明确的客观打分函数,搜索便失去了指南针。
- 计算资源:相比单词生成的单次调用,大规模树搜索需要昂贵的沙盒运行资源。
未来展望
ERA 的推出象征着 AI 对科学的贡献正在从“辅助润色论文”转向“实质性实验设计”。正如 AlphaGo 改变了围棋逻辑,ERA 及其代表的 LLM+Search 范式,正在把科学软件的迭代周期从“以年计”缩减为“以天计”。当 AI 开始学会从论文中提取灵魂并重组出超越人类的工具时,真正的“AI 高级助理”时代才算正式开启。
Takeaway: 如果你的科研流程中存在一个能清晰打分的测试环节,那么请做好准备,AI 的解决方案可能很快就会超过你的最优模型。
