这些代理的失败频率有多高?它们会犯哪些类型的错误?
失败率高得惊人,尤其是在安全攸关的场景中。在一项针对21种不同大语言模型、基于500个经医生验证的医疗案例的大型评估中,模型在40.6%的情况下选择了被故意篡改(“虚假”)的指南,而非正确的指南——这意味着它们几乎每5次决策中就有2次给出错误答案[1]。最严重的失败出现在最危险的改动上:模型未能识别被删除的警告、遗漏过敏信息、忽视禁忌症违规,失败率从54.2%到61.7%不等[1]。这意味着在超过半数涉及关键安全信息的案例中,人工智能选择了有害的选项。
另一篇评论当前医疗AI智能体的观点文章证实,这些问题并非个例。文章指出,不同模型在引用准确性上参差不齐,细微的误解和不可靠的参考文献仍普遍存在,且在涉及多步骤研究流程时,安全约束的可预测性会降低[3]。综合来看,这些发现表明,这些智能体并非仅犯下微小错误——它们在关乎患者安全的核心任务上已然失职。
这些失败的原因是什么——是根本性缺陷,还是可修复的漏洞?
这些失败源于智能体在信息处理方式上的深层结构性缺陷,而不仅仅是简单的程序错误。临床指南研究发现,模型严重受到呈现顺序偏差的影响:无论选项正确与否或被篡改,它们有72.7%的概率选择第一个呈现的选项[1]。这使得准确率完全取决于哪个选项排在首位,从82.3%骤降至36.7%——这意味着AI的决策很大程度上只是基于顺序的抛硬币式选择,而非真正的理解。
另一项关于基于大语言模型的机器人系统的研究指出,当前智能体在检索和证据排序机制上缺乏透明度,这引发了对其可复现性和潜在偏见的担忧[4]。该观点文章进一步补充道,检索过程仍不透明,导致难以审计智能体为何选择特定来源[3]。这些问题并非表面现象——它们表明智能体缺乏稳健的推理能力,且容易受输入信息的表层特征影响。
这些智能体目前能否在任何现实场景中发挥作用?
是的,但仅限于在人类密切监督下作为辅助工具,而非自主决策者。那些指出其缺陷的研究同样也展现了其真正的优势。例如,Agent Laboratory框架利用大语言模型进行文献综述、运行实验并撰写报告,能够生成达到最先进性能的机器学习代码,且相比以往的自主方法将研究成本降低了84%[2]。然而,每个阶段的人类参与都显著提升了最终成果的质量[2]。
这篇观点文章明确指出,应将这类智能体视为“辅助研究工具而非伪专家”,它们有助于加速信息收集,但绝不能替代人类严谨的判断[3]。一项关于虚拟现实中基于大语言模型的非玩家角色的研究表明,智能体能够生成符合情境的回应,并配合恰当的面部表情与手势,但这仅限于受控且低风险的娱乐场景[5]。五篇论文的共识清晰明确:这些智能体能够提升效率、降低成本,但在医学、金融或任何错误会引发严重后果的领域,它们尚不足以在无人监督的情况下可靠运行。
关于这些来源
该答案基于5篇经同行评审的研究——发表于2024年至2026年,其中5篇为2024年或之后发表,1篇发表于Q1期刊,累计被引用79次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程又源于从超过5亿篇论文数据库中检索到的57篇论文。
本文引用的文献
当智能体大语言模型信任被投毒的工具:临床大语言模型对抗性指南的脆弱性。
在一项针对21个大型语言模型(LLM)在500个临床案例中的大规模评估中,模型有40.6%的概率选择了被篡改的医疗指南,其中涉及安全关键变更的失败率高达61.7%,并且表现出强烈的呈现偏差(72.7%的模型选择了第一个选项)。
Agent Laboratory:使用大语言模型代理作为研究助手
Agent Laboratory框架利用大语言模型进行文献综述、实验和报告撰写,实现了最先进的代码性能,并将研究成本降低了84%,但在每个阶段引入人类反馈显著提升了输出质量。
深度研究智能体:医学AI的重大突破还是渐进式进展?(预印本)
一篇观点文章指出,深度研究智能体仅代表渐进式进步,而非范式转变,并援引了引用准确性不一致、检索过程不透明以及大规模放大错误的风险;文章建议将其用作辅助工具,而非自主专家。
面向实际应用的基于Agentic LLM的机器人系统:关于其自主性与伦理的综述
一项针对基于大语言模型(LLM)并在实际应用中验证的机器人系统的调查,引入了“自主性”分类及伦理评估框架,揭示了在透明度、安全防护机制及人类监督方面存在的不足——这些缺陷必须在部署前加以解决。
在社交虚拟现实中构建基于大语言模型的AI智能体
基于GPT-4的大型语言模型AI代理作为VRChat中的NPC部署时,展现了生成上下文相关回应并配合适当面部表情与手势的能力,但该评估仅为初步性质,且局限于低风险的娱乐场景。
