为什么边缘案例会暴露训练数据偏差?
大多数逆合成模型都在大型反应数据库上训练,因此它们天然偏向最常见的反应类型。边缘案例——不寻常的分子或罕见的断键方式——恰恰是这种偏差最明显的地方。2023年的一项研究表明,当要求标准语言模型预测目标分子的前体时,它往往会反复推荐同一类反应,从而限制了化学空间的探索[4]。这是训练数据不平衡的直接后果:模型见过的常见反应示例远多于罕见反应,因此即使另一种断键方式在化学上更优,它也会默认选择常见反应。
同一项研究发现,在输入前添加一个分类标记——即一个提示模型考虑哪种断键类型的小型提示词——能持续提升预测多样性[4]。这一点很重要,因为在实际的合成路线规划中,你往往需要尝试多种路径,而一个只给出单一类型答案的模型在面对边缘情况时毫无用处。另一篇2023年的论文则更进一步,通过使用指定具体断裂化学键的断键提示词,实现了比基线高出39%的性能提升[3]。这一提升直接反映了模型因偏向常见反应而受到多大程度的制约。
化学感知模型如何更好地处理边缘案例?
化学感知模型不仅依赖SMILES字符串(分子的文本表示),还融入了分子结构和官能团信息。这使它们能够更好地处理那些连接方式或局部环境至关重要的边缘情况。例如,G-MATT模型利用语法树编码局部结构和官能团,在USPTO-50K数据集上达到了51%的top-1准确率和79.1%的top-10准确率[1]。更重要的是,其无效率仅为1.5%,这意味着它极少提出化学上不可能的反应物——而这正是基于文本的模型在处理异常目标时常见的失败模式。
同一模型还实现了74.8%的生物活性相似率,这意味着其预测的大多数前体分子与已知的生物活性分子相似[1]。这是一个强有力的信号,表明它并非仅仅在记忆模式,而是真正理解了分解复杂类药分子所需的化学原理——而这正是制药研究中至关重要的边缘情况。
边缘情况何时需要策略性思考,而非仅仅模式匹配?
一些边缘情况并非关乎罕见反应,而是涉及特定合成策略的需求——例如保护某个官能团或避免某种副反应。一项2026年的研究表明,当大型语言模型(LLMs)与传统规划工具集成时,能够引导搜索算法走向具有化学意义的解决方案[2]。该模型并非直接预测结构,而是评估策略并引导搜索方向,这对于那些直接预测可能在化学上有效但合成上不切实际的边缘情况至关重要。
这项研究还指出,更新、更大的模型展现出日益复杂的化学推理能力[2]。这表明,随着模型在理解上下文和策略方面变得更强,它们也更能处理那些需要判断力而非单纯记忆的边界情况。然而,论文也指出,这种方法仍是一种范式转变——它将大语言模型的推理与传统算法相结合,因此尚不能作为即插即用的解决方案来应对所有边界情况。
关于这些资料来源
本回答基于5项同行评审研究——发表于2021年至2026年,其中1项为2024年或之后发表,4项发表于Q1期刊,合计被引用171次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的43篇文献。
本文引用的文献
G‐MATT:基于分子语法树变换器的单步逆合成预测
G-MATT,一种语法树变换器,在USPTO-50K上达到了51%的top-1准确率和79.1%的top-10准确率,无效率为1.5%,生物活性相似度为74.8%,表明引入分子语法能够提升对复杂结构的处理能力。
LLM中的化学推理能力解锁了策略感知的合成规划与反应机理阐释。
与蒙特卡洛树搜索集成的LLM能够通过自然语言评估策略来指导逆合成规划,较新/较大的模型展现出更复杂的化学推理能力,不过这仍是一种新兴范式,而非成熟解决方案。
使用断键提示词消除逆合成语言模型的偏差
使用断键提示(指定要断裂的键)使预测准确率比基线提高了39%,同时提升了多样性,这表明引导模型偏离训练数据偏差有助于处理边缘情况。
增强基于语言的单步逆合成模型中的多样性
在目标分子的SMILES前添加分类令牌,能够引导模型采用不同的断键策略,持续提升预测多样性,并支持递归合成以避免走入死胡同。
逆合成规划中的深度学习:数据集、模型与工具
2021年一篇关于逆合成中深度学习的综述涵盖了数据集、模型和工具,并讨论了现有模型的缺点,包括多样性有限和缺乏化学意识,而这些正是边缘案例失败的核心原因。
