My Chemical Harness:让 LLM 成为化学合成的“指挥官”而非“梦想家”

My Chemical Harness: Evolutionary Molecular Design over Synthetic Pathways with Large Language Model Agents

2026-01-01
César Ojeda, Darius A. Faroughy, Maryam Karimi, Payam Zarrintaj, Mir Mehdi Seyedebrahimi, Martín Carballo-Pacheco
总结
问题
方法
结果
要点
摘要

本文提出了 My Chemical Harness,一种基于大语言模型(LLM)智能体引导的“路径原生”进化分子设计框架。该框架将搜索对象从孤立的分子图转变为可执行的合成路径,利用 LLM 作为策略控制器来优化进化算法中的变异算子,实现了在保证合成可行性的前提下进行高效的分子发现。

TL;DR

传统的 AI 药物设计常常陷入“画饼容易吃饼难”的困境:生成的分子结构精妙,却无法在实验室合成。My Chemical Harness 改变了游戏规则:它将搜索目标从“分子结构”转变为“合成路径”,并利用 LLM 智能体 作为进化算法的策略大脑。实验证明,该方法在 sEH 任务上实现了 SOTA 性能,不仅分子的结合能更高,合成成功率更是接近 100%。

痛点深挖:为什么 AI 药研总是“不可合成”?

现有的深度生成模型(如基于 Transformer 或 Diffusion 的模型)本质上是在概率空间中进行模式匹配。它们学到了分子的结构分布,却没学到分子的物理起源(即如何一步步合成)。

  1. 化学幻觉:LLM 直接生成的 SMILES 字符串经常违反化学键价规则。
  2. 事后补偿的局限性:在生成分子后再去通过逆合成工具检查可行性,会导致搜索空间的大量浪费,因为绝大部分生成的候选者在化学上都是“死路一条”。

核心直觉:路径原生(Route-Native)进化

作者提出了一个深刻的洞见:分子的发现过程本质上是在化学反应模版可购买原料组成的巨大组合空间中的程序搜索。

因此,他们设计了一个名为 “Harness”(甲胄/约束)的框架,将系统分为两部分:

  • LLM 策略大脑:负责“高层决策”。它观察之前的实验结果,决定接下来是该尝试更长的合成路径,还是改进某个特定的反应步骤。
  • 确定性化学引擎:负责“底层执行”。使用 RDKit 等专业工具严格检查反应是否匹配 SMARTS 模版,确保每一个步骤都真实可靠。

架构解析

模型架构图 图 2:系统架构展示了 LLM 引导的策略生成与局部确定性执行之间的闭环。

这种设计的巧妙之处在于:LLM 不接触分子的微观原子结构,只负责权重规划(如增加某类高效反应的概率)。这种解耦不仅消除了幻觉风险,还让 LLM 强大的逻辑推理和总结能力得以在科学发现中施展。

变异算子:像代码重构一样设计分子

在进化过程中,系统提供了多种基于路径的变异算子(Mutation Operators):

  • Substitute Building Block:保留反应路径,仅仅更换其中一个原料。
  • Extend Parent:在现有成功路径的基础上增加一级反应。
  • Mutate Parent Prefix:修改路径的前半部分,重新生出后缀。

合成路径示例 图 1:一个可执行的合成反应路径示例,它是搜索空间中的基本遗传单位。

实验战绩:超越 SOTA

在 sEH(可溶性环氧化物水解酶)优化任务中,My Chemical Harness 展示了压倒性的优势。

方法sEH (结合能)SA ↓ (合成难度)AiZynth Finder (成功率)
SyntheMol0.643.080.82
Reasyn0.962.050.97
Reflective LLM (Ours)0.9841.9960.994

实验结果对比 图 3:优化随迭代次数的进展情况。可以看到 Reflective LLM(红色实线)在分数提升和化学空间覆盖方面均优于基准方法。

更令人振奋的是,通过对生成分子的分析,研究人员发现 LLM 自动富集了带有 脲基(Urea)和酰胺(Amide) 基团的结构。这与药物化学中已知的 sEH 抑制剂特征完美契合,证明了 LLM 确实学到了有价值的化学直觉。

深度洞察与总结

  1. 反思的力量 (Reflection):实验证明,带反思能力的 LLM 能够通过“学习报告”总结哪些反应容易失败、哪些片段是无效的,从而在接下来的设计中规避风险。
  2. 局部化学引擎的必要性:不要指望 LLM 懂量子化学。将化学真理硬编码在局部引擎中,让 LLM 专注于搜索策略(Strategic Exploration),这可能是未来 AI 实验室的标准范式。

局限性:目前该框架仍依赖于预定义的反应模版库和原料库。未来的方向是将其与真实的自动化合成平台对接,实现从“硅片设计”到“烧瓶合成”的完全闭环。

结论:My Chemical Harness 证明了,只要套上合适的“甲胄”(Constraints),即便不经过化学领域的微调,通用型 LLM 也能成为顶尖的分子设计师。

发现相似论文

试试这些示例

  • 查找最近其他试图通过将进化算法与大语言模型结合来进行药物分子或材料设计的相关论文。
  • 哪篇论文最早提出了 AlphaEvolve 框架,本文在变异算子的设计上是如何针对化学合成路径进行改进的?
  • 有哪些研究探讨了将这种基于合成路径的搜索框架应用到催化剂设计或其他具有高度约束的化学系统任务中?
目录
My Chemical Harness:让 LLM 成为化学合成的“指挥官”而非“梦想家”
1. TL;DR
2. 痛点深挖:为什么 AI 药研总是“不可合成”?
3. 核心直觉:路径原生(Route-Native)进化
3.1. 架构解析
4. 变异算子:像代码重构一样设计分子
5. 实验战绩:超越 SOTA
6. 深度洞察与总结