哪种方法能带来最佳准确率?
针对反应数据微调并经过化学推理训练的化学感知语言模型,其表现优于检索增强模型和标准微调模型。在USPTO-50K基准测试中,推理驱动的LLM(RetroDFM-R)实现了65.0%的top-1准确率[1],而化学专用LLM(ECNU-ChemGPT)达到了68.3%[4]。Top-1准确率指的是模型单一最佳预测与已知正确前体相匹配的情况——也就是说,在约三分之二的测试案例中,模型的首次建议是正确的。
基于检索的方法通过从文献中提取相关文本来增强预测,同样优于仅基于分子数据训练的模型,但未能达到同等精度。TextReact作为一种检索增强方法,在单步逆合成任务上显著超越了最先进的化学信息学模型[6],但其提升幅度不及微调后大语言模型(LLM)的Top-1得分。结论是:如果你的首要目标是原始预测精度,那么具备化学感知能力的大语言模型才是最佳选择。
人工审核在其中的作用是什么?
即使最优秀的模型也需要人工监督,因为它们可能会提出化学上不合理或不符合直觉的建议。对RetroDFM-R预测结果的双盲人工评估证实,这些预测在化学上具有合理性且具有实际用途[1],但这并不意味着它们总是正确的。另一项研究发现,经过微调的模型偶尔会偏离预期的反应路径,表现出一种“创造性”但有时错误的方法[5]。
当模型的建议被用于实际合成时,人工审查尤为重要。断键提示法[3]旨在让化学家对模型的建议拥有更多控制权,从而减少偏差并增加多样性——但它仍然依赖化学家来选择正确的断键位点。在实践中,专家应将模型输出视为强有力的起点,而非最终答案,并依据自身知识和实验室条件对其进行验证。
这些方法在实践中表现如何?
在反应数据上微调通用大语言模型是一个可靠的基线方法:一项研究在USPTO-50K上微调模型,成功为约92%的测试案例提出了逆合成路径[5]。这个数字听起来很高,但它包含了模型识别出正确反应类型和反应中心的情况,而不一定意味着精确的前体——因此这是一个更宽泛的“合理路径”指标,而非top-1准确率。
检索增强在您拥有大规模化学文献语料库并希望在不重新训练的情况下融入外部知识时非常有用。TextReact表明,将检索到的文本与分子表示对齐,其性能优于仅基于分子数据训练的模型[6]。然而,它仍无法媲美专用化学大语言模型的准确性,后者在海量反应数据集上训练,能够推理化学规则[1][4]。
最强的结果来自于将微调与化学推理和工具使用相结合。ChemCrow是一个可访问18种化学工具的LLM智能体,能够自主规划并执行真实的合成实验[2],这表明整合外部工具可以将LLM的能力推至纯预测之外。ECNU-ChemGPT同样采用多模型调度框架,针对不同任务调用专门模型,从而取得顶尖性能[4]。因此,最佳的实际配置是一个具备化学意识的LLM,能够调用外部工具和数据库,并由人类化学家参与最终验证。
关于这些来源
本回答基于6项研究(4项经同行评审,2项为预印本)——发表于2023年至2025年间,其中4项为2024年或之后发表,2项发表于Q1期刊,合计被引用495次——这些研究是从6项通过质量筛选的研究中选出的最相关者,而这些研究又源自从超过5亿篇论文数据库中检索到的33篇文献。
本文引用的文献
基于强化学习的大语言模型推理驱动逆合成预测
RetroDFM-R是一种基于推理驱动的大语言模型,通过强化学习和化学可验证奖励进行训练,在USPTO-50K数据集上达到了65.0%的top-1准确率,并通过了双盲人类评估,验证了其化学合理性。
用化学工具增强大型语言模型
ChemCrow是一个配备18种化学工具的LLM智能体,能够自主规划并执行驱虫剂和三种有机催化剂的合成,这表明工具集成显著扩展了LLM在化学领域的能力。
使用断键提示词消除逆合成语言模型的偏差
使用断键提示来引导逆合成语言模型,提高了前体多样性,并相较于基线实现了39%的性能提升,为化学家提供了对预测结果的更多控制。
用于化学和逆合成预测的大型语言模型
ECNU-ChemGPT,一款经过领域微调并采用多模型调度的化学专用大语言模型,在USPTO_50K数据集上达到了68.3%的Top-1准确率,并为真实药物分子重建了13条完整的实验路径。
将语言模型适配用于逆合成预测
在USPTO-50K上微调的大语言模型为约92%的测试案例提出了逆合成路径,尽管案例研究显示偶尔会偏离预期的反应路径。
基于文本检索增强的预测化学
TextReact能够检索并将文本描述与分子表示对齐,在反应条件推荐和单步逆合成任务上显著优于最先进的化学信息学模型。
