为什么医学基础模型会犯下危险的错误?
最关键的证据缺口在于医学幻觉的高发率——即输出内容存在事实错误、逻辑矛盾或缺乏临床依据。2025年一项针对11个基础模型(7个通用型、4个医学专用型)在七项医学任务中的评估发现,通用型模型生成无幻觉响应的中位比例为76.6%,而医学专用型模型仅为51.3%——两者相差25个百分点[1]。更令人担忧的是,医生审核显示,64%-72%的残余幻觉源于因果或时间推理的失败,而非知识缺失[1]。这意味着模型往往能正确获取事实,却在关联逻辑上出错,这在临床决策中尤为危险。
实际影响相当显著:在一项覆盖70名临床医生的全球调查中,91.8%的受访者曾遇到过医学幻觉,84.7%的人认为这些错误可能对患者造成伤害[1]。不过,该研究也发现了一种有希望的缓解方法:思维链提示(即让模型逐步展示其推理过程)在86.4%的对比测试中减少了幻觉,而表现最佳的模型(Gemini-2.5 Pro)采用该技术后准确率达到了97%[1]。这表明,差距不仅在于数据量的增加,更在于构建能够进行显式推理并自我验证输出的模型。
没有海量医疗数据集,我们能训练出好模型吗?
第二个重大缺口在于缺乏大规模、高质量且带有标注的医学数据集——收集这些数据成本高昂、耗时费力,还会引发隐私问题。本研究中的两篇论文从不同角度探讨了这一问题。其中一种方法采用了合成数据:研究人员在约100万张合成视网膜图像上预训练了一个视网膜基础模型,随后仅用先前最先进模型(RETFound)所需真实世界图像的16.7%进行微调。最终模型在九个公共数据集和四项诊断任务中表现相当或更优,而在糖尿病视网膜病变分级任务中,仅需专家标注训练数据的40%即可达到同等效果[4]。这表明合成数据能在一定程度上弥补数据缺口。
另一项研究利用社交媒体(医学推特)上公开分享的医学图像,构建了包含208,414张病理图像及其自然语言描述的OpenPath数据集。基于该数据训练的视觉语言模型在零样本分类任务中达到了最优性能,在四个外部数据集上的F1分数为0.565-0.832,而此前模型的F1分数仅为0.030-0.481 [2]。这两种方法表明,创造性的数据采集与合成生成技术能够减少对传统标注数据集的依赖,但也揭示了一个持续存在的差距:这些方法仍需经过严格验证,以确保数据具有代表性,且不存在其来源中固有的偏差。
通用模型在无需重新训练的情况下,对医学图像的处理效果如何?
第三个证据缺口在于通用视觉基础模型在医学图像上的零样本表现不佳。2023年一项研究测试了分割一切模型(SAM)在九项医学图像分割基准上的表现,涵盖OCT、MRI和CT等模态,以及皮肤科、眼科和放射科的应用。结果显示,尽管SAM在通用领域图像上表现良好,但其在医学图像上的零样本分割能力严重受限——对于血管等特定结构目标,甚至完全失败[5]。然而,即便仅使用少量医学数据进行微调,也能带来显著改进,这表明模型具有潜力,但需要领域特定的适配,而这一适配过程目前尚未得到充分理解或标准化[5]。
这一发现与2023年一篇综述中提到的更广泛挑战相吻合:医学基础模型涵盖从通用影像模型到特定器官或任务模型的“谱系”,每种模型在准确性、数据效率和泛化能力上各有不同的权衡[3]。证据表明,目前尚无单一模型架构或训练策略能适用于所有医学任务,且该领域缺乏系统性的基准测试来公平比较不同方法。
关于这些来源
该回答基于5篇经同行评审的研究构建而成——发表于2023年至2025年间,其中2篇为2024年及以后发表,3篇发表于Q1期刊,合计被引879次——这些研究是从7篇通过质量筛选的文献中选出的最具相关性的成果,而7篇文献又源自对超过5亿篇论文数据库中检索到的65篇论文的筛选。
本文引用的文献
基础模型中的医学幻觉及其对医疗保健的影响
对11个基础模型(7个通用型、4个医学专用型)在7项医疗任务中进行了评估;通用型模型的无幻觉率中位数为76.6%,而医学专用型模型为51.3%;64%至72%的残余幻觉源于推理失误,而非知识缺失;在70名接受调查的临床医生中,84.7%认为幻觉可能导致患者受到伤害。
用于病理图像分析的视觉-语言基础模型,基于医学推特数据构建
我们精心整理了OpenPath数据集,该数据集包含来自医疗推特的208,414张病理图像;并训练了视觉语言模型PLIP,在4个外部数据集上实现了0.565至0.832的零样本F1分数,而此前模型的分数仅为0.030至0.481。
关于基础模型在医学图像分析中的挑战与前景
这篇综述文章描述了医学基础模型的“谱系”(包括通用影像、特定模态、特定器官/任务),并探讨了它们在医学图像分析中的挑战、机遇与应用。
一种构建高性能医学基础模型的数据高效策略。
在约100万张合成图像上预训练了一个视网膜基础模型,随后仅使用RETFound所用真实世界数据的16.7%进行微调;在9个数据集和4项任务上达到或超越了RETFound的表现;在糖尿病视网膜病变分级任务中,仅使用了40%的专家标注数据。
通用视觉基础模型在医学影像中的应用:以Segment Anything模型在零样本医学分割中的案例研究
在9个医学图像分割基准上测试了Segment Anything Model(SAM)模型;其零样本性能在医学图像上表现有限,且对血管分割完全失败;通过少量数据微调后,性能得到显著提升。
