最佳情况下的准确率是多少,这到底意味着什么?
最强的量化结果来自2025年一项引入ECNU-ChemGPT的研究,这是一个化学专用大语言模型,在USPTO_50K数据集(包含5万条反应的标准基准)上达到了68.3%的top-1准确率。通俗地说,当被要求为给定分子提出正确的反应物时,它给出的首选建议大约每三次就有两次是对的。这算是不错的表现——在同一研究中优于GPT-4o等通用模型——但这也意味着每三个建议中就有一个是错的,而在一个错误路线会浪费时间和资源的领域,这一失败率不容忽视。
同一项研究还表明,该模型成功重建了来自药物化学期刊的13条真实药物分子的完整实验合成路线。这对实际应用而言是一个令人鼓舞的信号,但样本量小且经过人工筛选,并不能保证日常使用中的可靠性。结论是:最好的模型已经足够好,能够真正派上用场,但还不足以让人盲目信任。
为什么化学家仍需参与其中?
证据一致表明,需要人类的引导。2023年的一项研究显示,通过添加一个“断开提示”——告诉模型在哪里切断分子——模型的性能比基线提升了39%,并且它提出了更广泛、更多样化的前体。这意味着模型的默认行为受到其训练数据的偏差影响,需要化学家的输入来引导它走向更具创造性和实用性的建议。没有这种输入,模型往往会退回到熟悉的反应类型,限制了对化学空间的探索。
2023年的另一项研究进一步印证了这一点:通过在目标分子前添加分类标记,逆合成Transformer能够提高预测的多样性,使化学家可以引导模型采用不同的断键策略。这明确表明,这些工具并非自主的问题解决者,而是交互式助手,只有在人类设定方向时才能发挥最佳效果。2026年关于策略感知规划的研究则更进一步,显示当化学家用自然语言指定策略时,大语言模型能够引导搜索算法走向具有化学意义的解决方案——同样,人类是策略制定者,模型是执行者。
最佳情况与典型情况下的证据差距何在?
68.3%的准确率是来自一个经过专门、深度微调的模型的最佳情况数据。更广泛的文献,如2022年一项综述所总结的,指出人工智能驱动的逆合成分析仍面临诸多挑战,例如对专业知识的严重依赖以及路线并非最优等问题。该综述并未给出单一的准确率数字,但强调该领域仍在发展中,且没有任何单一方法能成为万能解决方案。
2023年的研究虽然未报告总体准确率,但表明即便是当时最先进的模型也存在偏差,需要通过提示来克服。这意味着,在没有精心设计提示或人工监督的情况下,典型表现很可能低于最佳情况下的68.3%。在实际应用中,药物化学家可能更少看到正确的建议,尤其是在训练数据覆盖范围之外的新颖或复杂分子上。因此,诚实的答案是:最好的模型正接近“有用助手”的水平,但“可靠”到“无需核查即可信任”的程度仍遥不可及。
关于这些资料来源
本回答基于5项研究(4项经同行评审,1项为预印本),发表于2022年至2026年间,其中2项为2024年或之后发表,3项发表于Q1期刊,累计被引用149次。这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的31篇文献。
本文引用的文献
LLM中的化学推理能力解锁了策略感知的合成规划与反应机理阐释。
2026年的一项研究表明,大型语言模型与蒙特卡洛树搜索相结合时,能够根据化学家指定的策略指导逆合成规划与机理阐释,且更新、更大的模型展现出日益复杂的推理能力。
使用断键提示词消除逆合成语言模型的偏差
2023年的一项研究发现,在逆合成语言模型中使用断开提示,相较于基线模型性能提升了39%,并增加了前体建议的多样性,使化学家能够控制断开预测。
增强基于语言的单步逆合成模型中的多样性
2023年的一项研究表明,在逆合成Transformer模型的目标分子前添加分类令牌,能够持续提升预测多样性,从而使递归合成工具能够规避死胡同。
用于化学和逆合成预测的大型语言模型
2025年的一项研究推出了ECNU-ChemGPT,这是一款化学领域专用的大语言模型,在USPTO_50K数据集上达到了68.3%的top-1准确率,并为真实药物分子重建了13条完整的实验路径,性能优于GPT-4o等通用模型。
用于逆合成预测的人工智能
2022年的一篇关于AI驱动逆合成预测的综述概述了该领域面临的挑战,包括对专业知识的依赖、路线次优以及计算成本高昂等问题,并对应对这些问题的AI技术进行了分类。
