[FAIR 2026] AIRA2:突破百小时科研搜索,自动化 AI 专家的新巅峰

AIRA_2: Overcoming Bottlenecks in AI Research Agents

总结
问题
方法
结果
要点
摘要

本文推出了 AIRA2,一种旨在解决 AI 研究智能体(AI Research Agents)三大结构性瓶颈的新型系统。通过引入异步多 GPU 框架、隐层一致性评估协议和 ReAct 动态算子,AIRA2 在 MLE-bench-30 榜单上取得了 71.8%(24小时)和 76.0%(72小时)的平均百分位排名(Percentile Rank),刷新了 SOTA 记录。

TL;DR

Meta FAIR 团队发布的 AIRA2 通过解决算力吞吐、评估噪声和算子僵化三大顽疾,在 MLE-bench-30 任务中实现了惊人的性能跨越。它不仅在 24 小时内达到了 71.8% 的平均百分位排名,更证明了在正确的架构设计下,AI 研究智能体的性能可以随计算资源(Compute)和时长持续单调提升,而不再陷入“越搜越差”的过拟合泥潭。

1. 为什么之前的 AI 研究员总会“走火入魔”?

在自动机机器学习(AutoML)向自主科研智能体演进的过程中,研究者们发现了一个诡异的现象:给智能体更多的搜索时间或算力,它的最终测试表现往往不升反降。

此前的主流观点(如 AIRA-dojo)认为这是过拟合导致的:智能体在长周期搜索中过度拟合了验证集。然而 AIRA2 指出,真正的元凶是结构性瓶颈

  • 同步瓶颈:当 GPU 在跑训练时,LLM “大脑”只能干等着,导致实验吞吐量极低。
  • 信号噪声:不规范的 Validation 脚本、随机的数据划分、甚至是代码 Bug 产生的“1.0 完美得分”,通过反馈回路误导了搜索方向。
  • 算子天花板:单轮的“Draft/Improve”提示词无法处理复杂的环境反馈,一旦脚本崩溃,搜索即刻止步。

2. AIRA2 的三根顶梁柱

AIRA2 的架构设计(见下图)通过“分而治之”的方式解决了上述问题。

AIRA2 架构图 图 1:AIRA2 架构。Orchestrator 维持进化种群,空闲 Worker 异步领取变异任务,利用 ReAct 模式在隔离容器中执行。

2.1 异步多 GPU 工人池 (Scaling Compute)

AIRA2 采用了稳态进化(Steady-state Evolution)。与传统的代际进化(必须等所有个体跑完)不同,只要有一个 GPU 工人空闲,Orchestrator 就会立刻指派新任务。这种解耦设计让 8 张 H200 GPU 的吞吐量实现了近乎 8 倍的线性增长,将原本需要数天的实验压缩到数小时。

2.2 隐层一致性评估 (HCE Protocol)

这是 AIRA2 最核心的物理直觉。作者提出了 Hidden Consistent Evaluation

  • 固定划分:将数据集预先划分为 D_train, D_search, D_val 且不可更改。
  • 隐藏标签:智能体可以看到得分,但看不到 D_search 的真实标签,杜绝了“刷分”的可能性。
  • 彻底防范 Bug:正如附录中的案例,有些 Agent 会写出由于类型不匹配导致始终返回 0 损失的 Bug,HCE 通过外部容器评估彻底过滤了这类伪信号。

2.3 ReAct 动态代理 (Beyond Static Operators)

不再给 LLM 固定指令,而是让它成为一个可以反复尝试的“活人”。通过 ReAct 模式(Reasoning + Acting),智能体可以查看报错日志、修正 Bug、调整超参,甚至在正式提交前进行局部的 EDA(探索性数据分析)。

3. 实验结果:打破性能魔咒

在代表性的 MLE-bench-30 榜单上,AIRA2 展现了统治级的表现。

AIRA2 性能曲线 图 2:在 MLE-bench-30 上的表现。注意其性能随计算预算(GPU-hours)增加而单调提升的趋势。

关键战绩:

  • 超越 SOTA:24 小时成绩 71.8%,超过了此前最强的 MARS+(69.9%)。
  • 长线增长:72 小时后,百分位排名一路攀升至 76.0%
  • 消融发现:最震撼的结论是,当使用 HCE 协议后,原本困扰业界的“搜索后期性能衰减”消失了(见下图)。这说明 AI 并没有变笨,而是以前的考卷(评估方式)弄丢了。

稳定长周期搜索 图 3:消融研究。绿色区域显示了 HCE 协议对消除性能下降的巨大贡献。

4. 深度洞察:AI 的“灵感”时刻

论文通过一个 Predicting Molecular Properties(分子属性预测)的案例展示了 AIRA2 的推理能力。在尝试引入辅助任务导致验证得分下降时,普通的贪婪算法会选择回滚。但 AIRA2 的 ReAct 代理通过分析日志发现:训练只跑了 15 分钟(限时 9 小时),波动是因为欠拟合而非方法错误。于是它果断加码算子、扩大模型规模,最终由于这一洞察拿下了其他所有 Agent 都没拿到的金牌。

5. 总结与局限

AIRA2 证明了 AI 研究智能体的核心挑战正在从“LLM 推理”转向“系统工程”。

它的局限性依旧存在:

  1. 数据污染风险:Kaggle 上的解法可能已存在于 LLM 训练集中,智能体可能只是在“回忆”而非“创造”。
  2. 算力门槛:这种大规模并行搜索在单卡环境下优势不明显。

未来的启示: AI Scientist 的终极形态可能不再是一个单一的大模型,而是一个由高性能实验基础设施支撑、拥有严密评估闭环的分布式系统。当人类能够将“实验-评估-学习”这一闭环彻底自动化且保证信号纯净时,真正的科学发现奇点也就临近了。

发现相似论文

试试这些示例

  • 查找最近一年内在 MLE-bench 或类似 Kaggle 自动化竞赛榜单上超过 AIRA2 性能的新型 AI 研究智能体。
  • 哪篇早期的论文首次定义了研究智能体中的“泛化间隙”或评估噪声问题,本文提出的分布式 HCE 协议与其有何继承关系?
  • 有哪些研究正尝试将这种基于进化算法和 ReAct 框架的科研智能体应用到生物信息学或新材料发现等非计算机科学领域?
目录
[FAIR 2026] AIRA2:突破百小时科研搜索,自动化 AI 专家的新巅峰
1. TL;DR
2. 1. 为什么之前的 AI 研究员总会“走火入魔”?
3. 2. AIRA2 的三根顶梁柱
3.1. 2.1 异步多 GPU 工人池 (Scaling Compute)
3.2. 2.2 隐层一致性评估 (HCE Protocol)
3.3. 2.3 ReAct 动态代理 (Beyond Static Operators)
4. 3. 实验结果:打破性能魔咒
4.1. 关键战绩:
5. 4. 深度洞察:AI 的“灵感”时刻
6. 5. 总结与局限