这些模型出错的频率有多高?专业化能否改善这一问题?
一项2025年的研究系统测试了11个基础模型——包括7个通用模型(如GPT-4、Gemini)和4个专为医学领域构建的模型(如MedGemma)——在七项医学推理与信息检索任务中的表现[1]。结果令人震惊:通用模型在76.6%的中位情况下能生成无幻觉的回答,而医学专用模型仅达到51.3%——两者相差25个百分点[1]。这意味着专用医学模型在避免危险错误方面实际上更差,而非更好。表现最佳的Gemini-2.5 Pro独立准确率达87.6%,采用思维链推理(一种逐步思考过程)时更超过97%[1]。相比之下,医学模型MedGemma在某些任务上得分低至28.6%[1]。关键启示:仅靠医学数据训练并不能保证安全性,复杂的推理能力更为重要。
哪些类型的错误最危险,它们发生的频率有多高?
同一项2025年的研究让医生对经过最佳实践提示后仍存在的幻觉进行了审核[1]。他们发现,64%–72%的残余错误并非源于医学知识缺失,而是因果或时间推理的失误——例如混淆症状与治疗的先后顺序,或将相关性误判为因果关系[1]。这一点至关重要,因为此类错误可能导致看似合理但临床逻辑颠倒的诊断或治疗方案。一项针对70名临床医生的调查证实了其现实影响:91.8%的受访者曾在实践中目睹医学幻觉,84.7%认为这些幻觉可能对患者造成伤害[1]。这些数据表明,当前侧重于事实准确性的安全测试,可能遗漏了最隐蔽的故障模式。
基于图像的模型(如病理学模型)是否存在同样的风险?
2023年的一项研究开发了一个病理图像模型,该模型基于医疗推特上的208,414张图像进行训练,并在新图像分类任务中达到了最先进水平——在零样本任务中,其F1分数(一种准确率衡量指标)介于0.565至0.832之间,远优于此前模型的0.030至0.481[2]。然而,即便是最高的0.832分也意味着约17%的分类存在错误。该研究并未直接评估模型产生幻觉或临床推理错误的情况,但风险依然存在:一个误判病理切片的模型可能导致癌症漏诊或不必要的治疗[2]。2023年《自然》杂志的一篇观点文章警告称,随着这些模型变得更加通用和灵活——能够同时解读图像、化验结果和文本——它们将对当前的监管和验证框架构成挑战,因为这些框架并非为如此复杂的多模态输出而设计[4]。根据2023年一篇法律论文的分析,《欧洲人工智能法案》也可能存在漏洞:即使是低风险的人工智能系统,仍可能对基本权利和用户安全造成损害,而该法案的覆盖范围在文本表述上可能比实际效果更广[5]。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2023年至2025年间,其中1篇为2024年及以后发表,3篇发表于Q1期刊,累计被引用2111次——这些研究是从5篇通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的67篇文献。
本文引用的文献
基础模型中的医学幻觉及其对医疗保健的影响
在2025年对11个基础模型进行的七项医疗任务评估中,通用模型的表现优于医学专用模型(无幻觉率中位数分别为76.6%和51.3%),而医生审核显示,64%至72%的残余错误源于推理失误,而非知识缺失;一项针对70名临床医生的调查发现,91.8%的人曾遇到模型产生幻觉的情况,84.7%的人认为这可能导致患者受到伤害。
用于病理图像分析的视觉-语言基础模型,基于医学Twitter数据构建
一项2023年的研究利用来自医疗推特的208,414张图像训练了病理图像模型(PLIP),在四个外部数据集上实现了0.565–0.832的零样本F1分数,达到当前最优水平,但即便最佳分数也意味着约17%的误分类风险。
关于基础模型在医学图像分析中的挑战与前景
一篇2023年的综述文章探讨了医学基础模型在图像分析中的潜力,指出这类模型能够减少对标注数据的依赖并提升诊断水平,同时也强调了包括安全性及需要严格验证在内的挑战。
面向通用医学人工智能的基础模型
《自然》杂志2023年的一篇前瞻性文章提出,通用型医疗人工智能(GMAI)将灵活解读多种数据类型并生成富有表现力的输出,但警告称此类模型将对当前医疗AI设备的监管与验证策略构成挑战。
一条让脚底发凉的毯子:探析《人工智能法案》中医疗AI的安全框架
2023年一项针对《欧盟人工智能法案》的法律分析指出,即使是低风险的人工智能系统,仍可能对基本权利和用户安全造成损害,且该法案的实际覆盖范围可能比其文本表述所暗示的更为有限。
