EvoMaster:开启大规模智能科学时代,让 AI Agent 像科学家一样进化
EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
本文推出了 EvoMaster,一个面向大规模智能科学(Agentic Science at Scale)的基础性演化智能体框架。该框架通过持续自演化机制,使智能体能够像人类科学家一样迭代假设并积累知识,在 HLE、MLE-Bench 等四大权威科学基准测试上刷新了 SOTA 记录。
TL;DR
在 AI 辅助科学发现(AI4S)的浪潮中,我们正从“AI 作为工具”转向“AI 作为自主研究员(Agentic Science)”。上海交通大学等团队发布的 EvoMaster 是首个专为大规模科学发现设计的基础演化框架。它不仅能让开发者用约 100 行代码定义一个新学科的智能体,更通过独特的持续自演化机制,在机器学习、物理、化学等多项顶级挑战中全面超越了现有的通用智能体框架,最高提升达 316%。
痛点深挖:为什么现在的 AI 智能体“不擅长”做科研?
科学研究本质上是一个长周期、不断试错、自我修正的过程。然而,目前的智能体框架存在两大致命伤:
- 烟囱式开发(Siloed Development):化学智能体懂实验操作但不通用,机器学习智能体懂调参但难以迁移。每个学科都要从头构建工具链,导致“横向扩展”极难。
- 单程思维(Stateless Execution):大多数框架像“翻译机”,给指令出结果。如果实验失败了,它们往往无法像人类一样总结经验并在下一轮尝试中改进,缺乏“演化”的灵魂。
核心方法论:EvoMaster 的四大支柱
为了打破僵局,EvoMaster 引入了类似“操作系统”的层级设计,将科学探索抽象为四个核心能力:
1. 模块化解耦 (Modular Composability)
EvoMaster 将系统划分为 Playground(编排层)、**Exp(实验执行层)**和 Agent(智能引擎层)。这种设计支持 Model Context Protocol (MCP) 标准,意味着你可以像插拔 U 盘一样更换底层的工具和模型,只需 100 行代码即可“变身”为物理、生物或材料学专家。
2. 迭代自演化 (Iterative Self-evolving)
这是框架的“大脑”。如图所示,Agent 不再是简单的线性执行,而是进入 “推理 -> 调用工具 -> 观察结果 -> 自我批评(Self-critique)” 的闭环。为了支持数百轮的实验,EvoMaster 内置了智能上下文管理器,通过 LLM 摘要和上下文压缩防止“遗忘”。

3. 三级认知缓存机制
在处理复杂的机器学习任务(MLE-Bench)时,EvoMaster 引入了“认知缓存”:
- Prefetch:预取过去的见解。
- Round-level Promotion:在轮次间同步有效经验。
- Run-level Wisdom:将最终成功的逻辑固化为长期知识。
实验与结果:统治级的性能提升
EvoMaster 在四个极具挑战性的基准测试上进行了测试,对比对象是目前开源界声量最高的通用框架 OpenClaw。
- MLE-Bench Lite (+316%):在 22 项 Kaggle 竞赛中,EvoMaster 拿下了绝大多数奖牌。这证明了其在处理超长周期、高强度工程任务时的稳定性。
- Humanity’s Last Exam (HLE, +202%):在涵盖数学、计算机、人文等多学科的“专家级”考试中,EvoMaster 表现出极强的跨学科常识与推理能力。
- FrontierScience (+191%):直接解决 PhD 级别的物理、化学、生物前沿问题,验证了其在硬核科学推理上的深度。

深度洞察:迈向 SciMaster 智能体生态
不仅仅是一个框架,基于 EvoMaster,团队已经孵化出了 SciMaster 生态,包括:
- ML-Master 2.0:自主机器学习大拿。
- PhysMaster:物理研究与推理专家。
- Browse-Master:深层网络科学信息检索。
这种“基础框架 + 领域 Skill”的模式,预示着未来科学研究的组织形式:科学家定义 Playground 规则,AI Agent 在框架下进行 24/7 的并行演化。
局限性与展望
尽管在数字世界(In Silico)表现强悍,EvoMaster 目前仍局限于计算和信息处理。它还不能直接操控实验室里的机械臂或云端化学实验室(Cloud Labs)。作者表示,未来将扩展 Session 抽象层,旨在直接连接物理实验协议,补完“科学发现闭环”的最后一块碎片。
总结: EvoMaster 不仅仅是刷榜的 SOTA 工作,它为“如何规模化构建科学 AI”提供了一套标准化、可进化的工业级方案。它告诉我们:AI 时代的科学发现,重点不在于模型有多大,而在于其演化系统有多完善。
