LLM智能体究竟如何减少幻觉?
最直接的证据来自2025年一项化学研究,研究人员利用大语言模型(LLM)预测一种名为拓扑极性表面积(TPSA)的分子性质。通过向LLM的输入补充相关数据,并借助机器学习优化提示词,他们将均方根误差从62.34降至11.76——降幅达81%[3]。这表明,即便是未经定制的简单LLM,也能通过巧妙的提示词设计和外部数据大幅提升可靠性,而无需重新训练模型。
另一篇2025年的论文构建了一个市场模型:AI智能体从上游大语言模型购买答案,再转售给用户。其核心洞见在于:当用户对准确性要求极高时(如法律或医疗领域),智能体会因经济利益驱动而私下验证答案——因为一次幻觉就可能导致未来业务终结。该模型表明,这种“声誉均衡”会自然促使智能体投入更多验证努力,从而在高风险领域实现更高可靠性[1]。这揭示出:市场设计——而非单纯的技术调整——同样能减少幻觉现象。
局限性与剩余风险有哪些?
尽管取得了这些成功,幻觉问题仍未消除。2024年一篇关于大语言模型在复杂系统研究中应用的综述指出,其行为具有不一致性,与“提示敏感性、幻觉乃至模型自身特性”密切相关[4]。这意味着即便采用优化后的提示词,同一大语言模型也可能因问题表述方式不同而产生不同水平的准确性,且没有任何单一解决方案能适用于所有模型。
2025年的化学研究虽然令人印象深刻,但仅聚焦于一项狭窄且定义明确的任务(预测单一分子性质)。尚不清楚同样的81%错误率降低是否适用于更广泛、开放的研究问题——这类问题中“正确”答案往往不那么明确[3]。同样,市场模型[1]假设验证是可行的,且用户能够识别出幻觉现象——但在复杂且依赖大量证据的工作流程中,错误往往难以察觉,这一假设未必总能成立。
LLM智能体在什么情况下最能有效减少幻觉?
证据表明,智能体在两种条件下表现最佳:高风险领域以及具有明确、可验证答案的任务。市场模型[1]特别指出,验证工作的强度会随着对准确性有高要求的用户比例增加而上升,这意味着医学和法律等领域自然会推动更高的可靠性。化学研究[3]之所以成功,是因为TPSA是一个定义明确、可计算的属性——大语言模型的输出能够对照已知公式进行检验。
有趣的是,2024年一项关于增强民主的研究发现,大语言模型在预测个人政治偏好时,比简单的“捆绑规则”(即假设人们按党派投票)更为准确;并且,将大语言模型的预测结果与概率样本相结合,比仅依赖样本本身能更精确地估计整体人群的偏好[5]。尽管这项研究并非直接针对幻觉问题,但它表明,大语言模型代理能够通过捕捉简单规则所忽略的细微差别,在数据增强任务(一种依赖大量证据的工作流程)中减少误差。
关于这些来源
该答案基于5篇经同行评审的研究构建而成——发表于2024年至2025年间,其中5篇为2024年或之后发表,1篇来自Q1–Q2期刊——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该5篇文献又源自一个包含超过5亿篇论文的数据库中所检索到的28篇论文。
本文引用的文献
代理型AI与幻觉
构建了一个竞争性市场模型,其中AI智能体可私下验证答案以减少幻觉现象;研究发现,在非平凡贴现条件下存在唯一的声誉均衡,且验证努力(及价格)随对准确性敏感的用户比例增加而提升,这意味着法律、医学等高 stakes 领域会内生地引发更严格的验证[1]。
当大语言模型识别你的空间:关于空间感知型大语言模型代理体验的研究。
在一项关于咨询对话的用户研究中,当大语言模型代理主动反映空间情境时,参与者报告了更高的共在感、信任度和自我表露程度。这表明环境意识能够改善用户体验和情感表达,尽管该研究并未直接衡量幻觉减少的效果[2]。
增强型与程序化优化的LLM提示词减少化学幻觉。
将增强生成与机器学习驱动的提示优化相结合,使大语言模型对拓扑极性表面积(TPSA)的预测均方根误差(RMSE)从62.34降至11.76——降幅达81%——且无需重新训练模型,这展示了一种在特定化学任务中减少幻觉的实用方法[3]。
用于复杂系统研究的大语言模型与生成式智能体模型。
综述了大型语言模型在复杂系统生成式智能体模型中的应用;发现LLM能够复现类人行为(如公平性、合作性),但也存在与提示敏感性、幻觉及模型特性相关的不一致性,凸显了控制AI驱动智能体所面临的挑战[4]。
大型语言模型(LLMs)作为增强民主的智能体。
在一项利用巴西2022年选举数据研究增强民主的研究中,基于公民偏好微调的大语言模型在预测个人政治选择时,比简单的“捆绑规则”(即假设按党派投票)更为准确;同时,将大语言模型的预测结果与概率样本相结合,得出的总体人口偏好比未增强的样本更为精确[5]。
