最强证据究竟揭示了什么?
最具说服力的一项研究是2025年发布的皮肤病学基础模型PanDerm,该模型基于来自11家临床机构、涵盖4种成像模态的200多万张真实世界皮肤病图像进行训练[1]。在三项读者研究中,PanDerm通过纵向分析在早期黑色素瘤检测方面比临床医生高出10.2%,在皮肤镜图像上将临床医生的皮肤癌诊断准确率提升了11%,并在临床照片上使非皮肤科医疗保健提供者对128种皮肤病的鉴别诊断能力提高了16.5%[1]。这是所综述研究中规模最大、最全面的评估,覆盖了28个多样化基准测试,包括皮肤癌筛查、风险分层和病灶分割[1]。
一项关于前列腺癌检测的2026年前瞻性研究(ProstNFound+)提供了另一项有力证据:该研究将医学基础模型适配于微型超声技术,并在五年后从新临床站点收集的数据上进行了测试[3]。结果显示,与回顾性评估相比,模型性能未出现下降,且其预测结果与标准临床评分方案(PRI-MUS和PI-RADS)高度一致[3]。这是所有研究中唯一的前瞻性验证,也是迈向实际临床应用的关键一步[3]。
一项2025年利用胸部X光进行骨质疏松筛查的研究发现,基础模型(DINOv2)的AUC达到了0.93(1.0为完美值),并通过聚焦脊柱和肋骨等相关骨骼结构,展现出清晰的临床推理能力[2]。然而,该研究也揭示了一个重要细节:医学基础模型并非始终优于自然领域模型,且更高的性能并不总是与更好的可解释性相关[2]。这表明,仅凭准确性不足以赢得临床信任。
这些模型在临床部署中面临的主要障碍是什么?
在全部10项研究中,最常被提及的障碍是缺乏大规模、前瞻性的真实世界临床验证[4][6][7][9][10]。一篇2025年的放射学综述明确指出,尽管基础模型在各项任务中表现优异,“从研究创新到可持续临床放射学实践的转化仍存在关键缺口”[7]。同样,一篇2026年的肿瘤学综述指出,“缺乏标注完善、多机构协作的队列数据,限制了模型开发与独立验证”[9]。
监管与伦理挑战是另一大障碍。2025年一项关于医学基础模型的综合调查指出,“尽管基础模型具有变革潜力,但它们也带来了独特的挑战”,包括算法偏见、数据隐私以及需要建立稳健的治理机制[10]。2026年一篇关于生成式AI在医疗领域应用的综述补充道,“针对基础模型辅助诊断的监管指南和政策制定仍在完善中”[6]。2023年的聊天机器人综述则警告当前模型存在“错误信息、不一致性以及缺乏类人推理能力”等问题[5]。
可解释性——即临床医生理解模型为何做出特定预测的能力——是一个反复被提及的关切点。骨质疏松筛查研究明确指出,“更高的性能并不总是与更好的可解释性相关”,并主张“在医疗AI中,可解释性应与准确性并重”[2]。病理学基础模型综述也指出,“基础模型在临床应用中仍存在若干挑战,作为使用者的医疗专业人员必须对此有所认识”[8]。
证据在哪些方面混杂或不完整?
关于医学专用基础模型是否始终优于通用模型,各项研究结论不一。骨质疏松筛查研究发现,“医学基础模型并未持续优于自然领域模型”[2],而皮肤病学研究则表明,专门基于医学数据训练的模型表现优于临床医生[1]。这种差异可能反映了任务复杂性和数据可用性的不同——皮肤病学拥有丰富且标准化的影像数据,而基于胸部X光片的骨质疏松筛查则更具偶然性,标准化程度较低。
另一个差距在于,不同基础模型在相同临床任务上缺乏直接对比。大多数研究仅评估单一模型或少量变体,导致难以确定哪种方法最适合特定应用场景[4][7][8]。2025年的放射学综述呼吁“评估方法标准化”[7],而2025年的综合调查也呼应了这一观点,指出“评估方法标准化不足”[10]。
最后,尽管皮肤病学和前列腺癌的研究显示出令人鼓舞的结果,但这仅涉及两个临床领域。病理学综述[8]和肿瘤学综述[9]均强调,大多数基础模型仅在狭窄任务上(例如,基于单一影像模态的癌症诊断)进行了测试,而非涵盖临床决策的完整范围。正如2025年综合调查所指出的,“一个关键差距依然存在——从研究创新到可持续临床放射学实践的转化”[7]。
关于这些来源
该回答基于10篇经同行评审的研究——发表于2023年至2026年间,其中9篇为2024年或之后发表,6篇发表于Q1期刊,累计被引用173次——这些研究是从58篇论文中筛选出的10篇通过质量审查的文献中,选取的最具相关性的成果,而58篇论文则源自一个涵盖超过5亿条记录的数据库。
本文引用的文献
面向临床皮肤科的多模态视觉基础模型
在这些研究中规模最大、最全面的评估中,一个基于来自11家机构超过200万张图像训练的皮肤科基础模型(PanDerm),在早期黑色素瘤检测方面比临床医生表现高出10.2%,并在128种皮肤疾病的诊断中将非皮肤科医生的准确率提升了16.5%[1]。
可解释的胸部X光机会性骨质疏松筛查:基础模型的回顾性比较
在一项对21,031张胸部X光片的回顾性研究中,DINOv2基础模型在骨质疏松筛查中达到了0.93的AUC,但医学基础模型并未始终优于自然领域模型,且更高的准确率并不总是意味着更好的可解释性[2]。
ProstNFound+:一项利用医学基础模型进行前列腺癌检测的前瞻性研究
在这些研究中,唯一一项前瞻性验证显示,前列腺癌检测模型(ProstNFound+)在五年后应用于新临床站点的数据时,其性能未出现下降,且预测结果与标准临床评分保持一致[3]。
放射学中的基础模型:是什么、如何用、为何用及为何不用
2025年的一篇放射学综述指出,基础模型通过大量未标注数据进行训练,在多项任务中表现出色,但强调需要以安全且负责任的方式进行训练,以惠及患者和医疗服务提供者[4]。
临床实验室医学中的AI聊天机器人:基础与趋势
2023年一项关于实验室医学中人工智能聊天机器人的综述指出,尽管聊天机器人在教育和结果解读方面具有潜力,但它们存在错误信息、不一致性以及缺乏类人推理能力等问题,因此在临床使用前需要进行广泛验证[5]。
生成式AI在医疗健康领域的应用:基础模型、临床实践、伦理考量与监管挑战
2026年关于生成式人工智能在医疗领域应用的综述指出了关键障碍,包括算法偏差、缺乏大规模临床验证以及监管框架不成熟,并得出结论:成功实施依赖于健全的治理和伦理保障[6]。
面向放射影像分析的大规模基础模型:临床应用、技术挑战与未来方向
2026年的一篇放射学综述指出,研究创新与临床实践之间存在关键差距,该综述提供了部署策略,并指出了在15个医疗系统中临床验证、监管审批及伦理实施方面面临的挑战[7]。
病理学基础模型
一份2025年的病理学综述报告指出,基础模型已应用于疾病诊断、生存预测和生物标志物评分,但同时也强调,在临床应用中仍存在持续挑战,医疗专业人员必须对此有所认识[8]。
临床肿瘤学中的基础模型:进展与展望
一篇2026年的肿瘤学综述指出,基础模型在筛查、诊断和治疗选择方面取得了进展,但关键障碍包括数据标准的不一致性、多机构队列数据的稀缺性,以及监管指南尚在完善中[9]。
医学基础模型综述
2025年一项关于医学基础模型的综合调查,涵盖了其发展历程、在临床自然语言处理、医学影像及组学领域的应用,并重点指出了算法偏差、数据隐私以及负责任部署需求等挑战[10]。
