基础模型究竟在哪些方面真正帮助了患者?
关于改善临床结局的最有力证据,来自基于结构化医疗数据(如电子健康记录和医学影像)训练的模型,这些模型专用于定义明确的预测任务。例如,一款结合病理切片与临床数据的基础模型,在预测乳腺癌对化疗的反应时,识别肿瘤完全缓解患者的准确率高达99.4%,并能标记出可能需要更强治疗方案的高风险患者[2]。同样,另一款肺癌筛查模型通过处理CT扫描、文本及表格数据,将癌症风险预测能力提升高达20%,心血管死亡风险预测能力提升10%,均优于现有最先进方法[3]。这些模型并非盲目猜测——它们能生成可解释的热力图,将预测结果与肿瘤环境中的具体特征相关联,为医生提供可操作的临床见解。
另一个前景广阔的方向是基于电子健康记录(EHR)进行事件发生时间预测。MOTOR模型在5500万份患者记录(90亿个临床事件)上进行了预训练,将住院再入院等事件发生时间的预测准确率较现有方法提升了4.6%,并且达到相同精度所需的有标签数据量减少了高达95%[4]。这意味着医院无需依赖庞大且昂贵的数据集,即可部署精准的风险预测模型。基于类似Transformer架构的ARES系统,在预测ICU入院和长期住院方面优于传统早期预警评分(如NEWS),并为每项风险评估提供了个性化解释[5]。这些工具能够帮助医生更早、更精准地进行干预。
问题何在?幻觉与安全风险
实际应用中的最大障碍是“医学幻觉”问题——即输出内容在事实上错误、逻辑不一致或缺乏证据支持。一项对11个基础模型(7个通用模型、4个医学专用模型)的全面评估发现,医学专用模型的表现实际上更差,其无幻觉回答的比例仅为28.6%–61.9%,而通用模型的中位数为76.6%[1]。即便是表现最好的通用模型Gemini-2.5 Pro,也需要借助思维链提示才能达到97%的准确率;若无此提示,其幻觉发生率为12.4%。医生审核显示,64%–72%的残余幻觉源于因果或时间推理错误——而非简单的知识缺失——这意味着模型虽然事实正确,但错误地连接了这些事实。
现实中的风险不容小觑:一项覆盖70名临床医生的全球调查显示,91.8%的受访者曾遭遇过AI产生的医学幻觉,84.7%的人认为这些错误可能对患者造成伤害[1]。这意味着,即便某个模型在基准测试中表现优异,若未经人工验证便直接用于指导治疗决策,仍可能导致危险后果。颇具讽刺意味的是,专门基于医学数据训练的模型(如MedGemma)表现反而不及通用模型,这表明安全性更多源于大规模预训练所培养的广泛推理能力,而非狭隘的领域优化[1]。就目前而言,这些模型最适合作为辅助工具——用于风险提示或方案建议——而最终决策仍需由人类医生做出。
谁最受益,在什么条件下?
最可能受益的患者,是那些拥有结构化、高质量数据且预测任务明确的人群。例如,接受化疗的乳腺癌患者可通过整合病理切片与临床病史的模型获得个性化风险评估[2]。肺癌筛查参与者能通过分析其CT影像和病历的单一模型,同时获得更精准的癌症与心脏病风险评分[3]。在医院场景中,患者可受益于ARES这类实时风险监测系统——该系统能随新数据动态更新风险评估结果[5]。
然而,这些优势取决于若干条件。首先,模型必须使用与患者群体相似的数据进行训练——跨机构迁移性仍在测试中,尽管MOTOR模型已证明可在不同医院系统间迁移[4]。其次,模型必须用于其预设任务:擅长预测化疗反应的模型不应被要求诊断罕见疾病。第三,人工监督不可或缺。研究一致表明,即使最优秀的模型也会出错,而这些错误的后果可能十分严重[1]。最后,模型的预测结果必须具有可解释性——医生需要理解模型为何将某位患者标记为高风险,才能信任并依据该信息采取行动[2][5]。满足这些条件时,基础模型可成为改善诊疗效果的有力工具,但尚未能替代临床判断。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2023年至2026年间,其中4篇为2024年及以后发表,累计被引用106次——这些研究是从6篇通过质量筛选的文献中选出的最具相关性的成果,而该6篇文献又源自从超过5亿篇论文的数据库中检索到的64篇论文。
本文引用的文献
基础模型中的医学幻觉及其对医疗保健的影响
在7项医疗任务中评估了11个基础模型:通用模型的幻觉率仅为76.6%,而医学专用模型为51.3%;在70名接受调查的临床医生中,84.7%认为幻觉可能对患者造成伤害。
预测乳腺癌新辅助化疗结果的基础模型。
一种整合病理图像与临床数据的混合AI模型,在包含227名患者的盲法测试队列中,预测乳腺癌对化疗的完全缓解率达到99.4%的AUC,预测4年无病生存率达到88.5%的AUC。
面向肺癌筛查的医学多模态多任务基础模型。
M3FM模型在163,725个胸部CT序列和17项任务上进行了训练,与最先进的模型相比,将肺癌风险预测能力提升了高达20%,并将心血管死亡风险预测能力提升了10%。
MOTOR:一种用于结构化医疗记录的时间至事件基础模型
MOTOR在5500万份患者记录(90亿个临床事件)上进行了预训练,其时间依赖性C统计量相比现有最优方法提升了4.6%,并在19项任务中将所需标注数据量减少了高达95%。
面向自适应风险评估的电子病历基础模型。
基于ETHOS变压器模型驱动的ARES系统,在利用MIMIC-IV数据库中285,622名患者的健康时间线数据预测ICU入院及长期住院方面,表现优于传统早期预警评分(NEWS、MEWS)。
