WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

医学基础模型对不同患者群体的适用性如何?

医疗基础模型展现出潜力,但在应对多样化人群时仍面临挑战,尤其是在罕见疾病和非英语数据方面。其表现差异显著。

直接答案

医学基础模型在处理不同患者群体时表现参差不齐。最有力的证据表明,在获得足够本地数据的情况下,这些模型能够很好地适应不同医院和任务,其表现往往达到甚至超越传统模型,且所需训练样本数量远少于后者[1]。然而,它们也存在严重缺陷:一项重要研究发现,即便是医学专用模型,在高达72%的案例中也会产生幻觉(即输出事实上错误或具有临床危险的结果),而这些错误往往源于推理缺陷而非知识盲区[2]。综合来看,规模最大、最全面的评估研究一致表明,模型性能高度依赖于训练数据的多样性及具体任务类型——基于广泛多模态数据训练的模型,其表现优于数据范围狭窄的专用模型[3][4]

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

这些模型在不同医院和患者群体中的适应能力如何?

一项大型多中心研究测试了一个公开可用的电子健康记录基础模型(该模型基于美国一家医院的257万份记录训练而成),并将其应用于另外两家医院的数据:加拿大一家儿童医院(SickKids)和MIMIC-IV重症监护数据库。该模型的适应能力非常出色:在仅使用1%的本地数据进行持续训练后,其性能便达到了使用全部本地数据训练的传统模型(梯度提升机)的水平,并且相比从头训练一个新基础模型,样本效率提高了60%–90%[1]。这意味着,即使是在相对同质化的人群中训练的模型,也能通过高效微调,在截然不同的环境中良好运行——这对于在多样化的临床环境中部署模型而言,无疑是个好消息。

然而,同一项研究也发现,现成模型(未经任何本地调优)只有在获得全部数据时才能达到传统模型的性能水平,其主要优势体现在低数据场景下——当训练标签稀缺时,性能提升了13%[1]。因此,该模型处理多样性的能力确实存在,但具有条件性:它至少需要少量本地数据进行适配,并且在数据有限的情况下表现最为突出,而非在已有充足本地数据的场景中。

罕见病、非英语语言与安全性问题如何?

一项针对11个基础模型(7个通用模型、4个医学专用模型)在七项医疗任务中的综合评估发现,通用模型的实际表现优于医学专用模型,其中位无幻觉响应率为76.6%,而医学专用模型为51.3% [2]。这一发现至关重要:明确基于医疗数据训练的模型反而更可能产生事实错误或临床危险的输出。医生审核显示,64%–72%的错误源于因果或时间推理的缺陷,而非知识缺失 [2]。对于多样化的患者群体——其中罕见病、非典型表现或非英语语言较为常见——这种推理失误尤为危险,因为模型可能自信地生成听起来合理但错误的答案。

一项独立研究通过开发多模态、多领域、多语言的基础模型,直接解决了罕见病与非英语语言的问题。该模型在涵盖2种传染病和14种非传染病的九个数据集上取得了优异表现,其中包括标签数据稀缺甚至缺失的罕见疾病[6]。这表明,基于多样化数据类型(图像、文本)和语言进行训练确实能带来帮助,但模型仍然依赖于训练数据的广度——它并非万能灵药。

一项覆盖全球70名临床医生的调查发现,91.8%的受访者曾遭遇人工智能产生的医学幻觉,84.7%的人认为这些幻觉可能对患者造成伤害[2]。因此,尽管基础模型可适配不同人群,但其在复杂或罕见病例中尤其容易产生幻觉的倾向,仍是限制其实际应用的一项重大安全隐患。

哪些训练策略能提升模型在不同群体中的表现?

最有力的证据指向在大型、多样化、多模态数据集上进行训练。一款皮肤病学基础模型(PanDerm)基于来自11家机构、涵盖4种成像模态的超过200万张真实世界皮肤病图像进行了预训练。该模型在28项基准测试中取得了最先进的结果,且在使用仅10%标注数据的情况下,其表现往往优于现有模型[3]。在读者研究中,该模型将临床医生在皮肤镜诊断中的准确率提升了11%,并将非皮肤科医生对128种皮肤病的鉴别诊断能力提高了16.5%[3]。这表明,训练数据的广度直接转化为对多样化患者表现更优的处理能力。

类似地,一个基于多样化生物医学数据训练的通用视觉语言模型(BiomedGPT)在25项实验中,有16项达到了最先进水平,在问答任务中错误率低至3.8%,在撰写放射学报告时错误率为8.3%[4]。作者明确指出,利用多样化数据进行有效训练,能够开发出更实用的AI,从而提升诊断准确性和工作流程效率[4]

另一方面,一项关于癌症专用基础模型的研究发现,目前大多数单细胞模型主要基于健康细胞进行训练,且严重偏向外周血单核细胞,这引发了对其在癌症场景中泛化能力的质疑[5]。这表明,即使训练数据规模庞大,但若范围狭窄,仍可能限制模型处理多样化患者群体的能力,尤其是那些具有疾病特异性分子特征的患者。

关于这些来源

该答案基于6篇经同行评审的研究——发表于2024年至2025年间,其中6篇为2024年或之后发表,5篇来自Q1期刊,累计被引用322次——这些研究是从通过质量筛选的6项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的56篇文献。

本文引用的文献

1

一项关于共享基础模型在电子健康记录中适应性的多中心研究

在一项多中心研究中,基于美国某医院257万份电子健康档案(EHR)训练的基础模型成功迁移至另外两家医院:在仅使用不到1%的本地数据进行持续训练后,其表现即与基于全部本地数据训练的传统模型相当,且相比从头训练本地基础模型,样本效率提升了60%至90%[1]。

2

基础模型中的医学幻觉及其对医疗保健的影响

在评估11个基础模型在七项医疗任务中的表现时,通用模型的平均无幻觉率为76.6%,而医学专用模型为51.3%;医生审核发现,64%至72%的错误源于推理失误,而非知识欠缺[2]。

3

面向临床皮肤科的多模态视觉基础模型

一个基于多模态皮肤病学的基础模型(PanDerm),在来自11家机构的超过200万张涵盖4种模态的图像上进行了预训练,在28项基准测试中达到了最先进水平,通常仅需使用10%的标注数据,并在128种疾病条件下将临床医生的诊断准确率提升了11%,非皮肤科医生的鉴别诊断准确率提升了16.5%[3]。

4

面向多样化生物医学任务的通用视觉-语言基础模型

BiomedGPT是一种基于多样化生物医学数据训练的轻量级通用视觉语言模型,在25项实验中,有16项达到了最先进水平,其中问答任务的错误率为3.8%,放射学报告撰写的错误率为8.3%[4]。

5

摘要 IA02:癌症特异性基础模型:医疗AI中的朋友还是敌人?

目前大多数单细胞基础模型主要基于健康细胞训练,且偏向于外周血单核细胞,这引发了对模型在癌症特定情境下泛化能力的担忧;为此,有研究提出了一种基于来自40多种肿瘤类型的恶性细胞训练的癌症特异性模型(CancerFoundation)以解决这一问题[5]。

6

一个用于零样本临床诊断的多模态、多领域、多语言医学基础模型

一个多模态、多领域、多语言的基础模型在涵盖2种传染性疾病和14种非传染性疾病的九个数据集上取得了优异表现,这些数据集包括罕见疾病以及标注数据稀缺的非英语语言[6]。