为什么数据准备和训练成本比表面看起来更高
最大的隐性成本在于训练数据的整理与筛选。例如,ChemDual框架为了微调一个用于反应及逆合成预测的大型语言模型,需要构建一个包含440万条指令的庞大数据集[4]。这不仅仅是一个数字——它意味着你需要获取、清洗并格式化数百万条化学反应数据,而如果你手头没有现成的此类数据集,这一过程既耗时又昂贵。
即便使用较小的数据集,标注和验证的成本也会不断累积。例如,G-MATT模型采用了化学感知的语法树,在USPTO-50K数据集上达到了51%的top-1准确率,但这需要设计专门的分子语法树表示[3]。这并非现成可用的方案;你需要专业知识来构建和维护此类表示,而且训练树到序列的Transformer模型的计算成本也不容小觑。
关于这些来源
本回答基于6项同行评审研究——发表于2023年至2026年,其中3项为2024年或之后发表,3项发表于Q1期刊,合计被引用80次——这些研究是从6项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的44篇文献。
本文引用的文献
使用断键提示词消除逆合成语言模型的偏差
在逆合成语言模型中使用断键提示,相较于基线方法将预测多样性提升了39%,但这一方法需要人工输入或自动识别断键位点,从而增加了复杂性。
增强基于语言的单步逆合成模型中的多样性
带有分类令牌的逆合成Transformer提高了预测多样性,但需要精心设计令牌并在推理时进行引导,以避免在合成规划中陷入死胡同。
G‐MATT:基于分子语法树变换器的单步逆合成预测
G-MATT模型利用化学感知语法树,在USPTO-50K数据集上达到了51%的top-1准确率和1.5%的无效率,但需要专门的树表示和Transformer架构。
利用大语言模型与双任务学习增强化学反应及逆合成预测
ChemDual这一大语言模型框架需要440万条指令数据集和双任务学习才能达到最先进的性能,凸显了高昂的数据与训练成本。
LLM中的化学推理能力解锁了策略感知的合成规划与反应机理阐释。
与蒙特卡洛树搜索集成的LLM实现了策略感知的逆合成规划,但需要混合系统,并需与传统搜索算法进行精细整合。
利用大型语言模型和知识图谱实现大分子的自动化逆合成规划
基于LLM的大分子逆合成智能体需要整合知识图谱和多分支路径搜索算法,这增加了处理多中间体反应的复杂性。
