如何让AI智能体基于事实推理,避免产生幻觉式断言?
防止虚假声明的最有效方法,是将领域知识直接嵌入AI的推理过程中。与其让模型自由联想,不如采用像ChatBattery这样的框架,利用专家知识引导的思维链推理,将模型引向化学上合理的假设。这种方法成功合成了三种新型锂离子电池正极材料,其容量相比标准NMC811材料分别提升了28.8%、25.2%和18.5%[1]。关键在于,AI的推理受到已知材料科学原理的约束,而不仅仅是依赖统计模式。
另一种策略是使用基于领域特定文献训练的语义嵌入。ElementBERT是一种在129万篇合金相关摘要上训练的语言模型,能够捕捉化学元素及其关系的潜在知识。当将其用作预测材料性能的描述符时,它在多个任务中的准确率比传统经验描述符高出多达23%[3]。这表明,将人工智能扎根于专业科学文本有助于其做出更可靠的推断,从而减少生成听起来合理但实际错误的论断的可能性。
多个AI代理相互核查能否减少虚假陈述?
是的,多智能体协作相当于一个内置的同行评审系统。MASTER框架采用分层智能体结构,其中包括一个同行评审智能体,负责对其他智能体的推理过程提出批评意见。在铜表面CO吸附的测试中,与试错法相比,该方法将所需的原子级模拟次数减少了高达90%,同时仍能做出基于化学原理的决策[2]。作者明确指出,推理轨迹无法用随机采样或语义偏差来解释,这意味着智能体确实在评估化学合理性。
这一验证层至关重要,因为它能在错误扩散之前将其拦截。一篇关于主动推理AI系统用于科学发现的2025年论文强调了验证层的重要性,该层将科学主张划分为可形式化证明的组成部分[6]。通过让智能体相互质疑彼此的假设,并与已知物理规律进行核对,系统产生自信但错误结论的可能性就会降低。
为什么用模拟或实验进行验证至关重要?
AI预测的可靠性取决于其验证过程。这项交替磁性材料发现研究使用了预训练的图神经网络来预测交替磁性概率,但随后通过第一性原理电子结构计算确认了全部50个新候选材料[4]。这种两步流程——AI提出、物理验证——确保了AI的建议不仅合理,而且确实正确。研究发现,AI搜索引擎的表现远优于人类专家,但最终确认仍需严格的计算验证。
同样地,SyMDis方法学习可解释的符号规则,这些规则能够通过物理和化学验证,而非依赖黑箱模型。它在未见数据集上的零样本评估中表现与最先进的优化器相当,同时返回高性能候选方案[7]。这种可解释性至关重要:如果AI能够以物理规则的形式解释其推理过程,就更容易识别虚假声明。关于材料发现生成模型的综述也强调,将AI与闭环系统中的实验工作流相结合,是克服数据稀缺和可合成性等局限性的有前景途径[5]。
关于这些来源
这个回答基于7项研究(2篇同行评审,5篇预印本),发表于2023年至2025年间,其中6篇为2024年或之后发表,1篇发表于Q1期刊。这些研究是从12项通过质量筛选的研究中选出的最相关者,而这12项研究又源自从超过5亿篇论文的数据库中检索到的76篇文献。
本文引用的文献
专家引导的大语言模型推理用于电池发现:从AI驱动的假设到合成与表征
ChatBattery,一个专家引导的大语言模型推理框架,成功识别、合成并表征了三种新型锂离子电池正极材料,其容量相较于NMC811分别提升了28.8%、25.2%和18.5%,展示了从设计到合成的完整AI驱动闭环。
用于自主功能材料发现的分层多智能体大语言模型推理
MASTER,一个层级式多智能体大语言模型框架,在两个化学应用中将所需的原子级模拟减少了高达90%,同时生成了化学上合理的决策,这些决策无法用随机采样或语义偏差来解释。
化学元素的语义嵌入用于增强材料推断与发现
ElementBERT是一种基于BERT的模型,在129万篇合金相关摘要上训练而成,其生成的语义嵌入在多个材料推断任务中的预测准确率比传统经验描述符高出最多23%。
AI加速发现交错磁性材料
利用预训练图神经网络和微调分类器的人工智能搜索引擎发现了50种新的交变磁性材料,并通过第一性原理计算得到证实,其表现优于人类专家。
人工智能与生成模型在材料发现中的应用——综述
该综述涵盖了用于材料发现的AI驱动生成模型,探讨了数据稀缺、计算成本、可解释性、可合成性及数据集偏差等挑战,并强调闭环发现系统是一种前景广阔的方法。
用于科学发现的主动推断人工智能系统
本文提出了一种用于科学发现的主动推理人工智能系统,并配备了一个验证层,将论断划分为可形式化证明的组成部分,旨在加速计算材料发现。
用于材料发现的符号学习
SyMDis是一种符号学习方法,能够在大型数据库中发掘接近最优的材料,同时学习可解释的规则以辅助物理和化学验证,并在零样本评估中泛化至未见过的数据集。
