AI病理模型的整体准确度如何?
一项涵盖100项研究、涉及超过15.2万张全切片图像的大型荟萃分析发现,AI模型的平均灵敏度达到96.3%,特异度为93.3%[1]。灵敏度意味着模型能正确识别出100个实际病例中的96个;特异度则表示它能正确排除100个健康案例中的93个。这些数据表明,在所研究的特定任务中,AI的平均表现与人类病理学家相当甚至更优。然而,同一篇综述指出,99%的纳入研究至少存在一个高或不明确的偏倚风险领域,这意味着针对不同人群的实际应用准确率可能低于这些表面数据[1]。
基础模型与任务特定训练:哪个更能应对多样性?
该系列中规模最大的验证研究——涵盖来自11个国家15个医疗中心的7,342名患者的超过10万例前列腺活检样本——直接对比了两类人工智能模型:基础模型(基于海量数据预训练的大型通用模型)与任务专用模型(针对特定任务从零开始训练)[5]。关键发现是:基础模型并未全面优于任务专用模型。当有足够标注训练数据时,任务专用模型的表现与基础模型相当甚至更优,且产生的临床显著误诊更少[5]。基础模型仅在训练数据稀缺时展现优势——这在罕见病或代表性不足人群的研究中较为常见——但其能耗高达任务专用模型的35倍,引发可持续性担忧[5]。该研究认为,对于临床应用而言,在目标人群中进行严格验证比选择基础模型更为重要。
最新的AI助手(如PathChat)表现如何?
2024年的一项研究推出了PathChat,这是一个基于超过45.6万条病理学专用视觉语言指令训练而成的视觉语言AI助手[4]。在涵盖多种组织类型和疾病的多项选择题诊断测试中,它的表现优于GPT-4V(ChatGPT-4背后的模型),并且人类病理学家更倾向于选择它的回答[4]。尽管这表明专业AI能够处理广泛的病理学任务,但该研究并未专门测试其在不同患者群体(如种族、民族或社会经济状况)中的表现。因此,虽然PathChat是教育和研究领域颇具前景的工具,但其应对多样化患者群体的能力仍有待检验。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2022年至2025年间,其中4篇为2024年及以后发表,3篇发表于Q1期刊,总被引次数达497次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的65篇论文。
本文引用的文献
数字病理学中的人工智能:诊断测试准确性的系统综述与荟萃分析
在一项涵盖超过15.2万张全切片图像、纳入100项研究(其中48项用于荟萃分析)的系统性回顾与荟萃分析中,人工智能模型的平均灵敏度为96.3%,特异度为93.3%。然而,99%的研究至少在一个方面存在高或不明确的偏倚风险,这表明所报告的准确率可能无法反映真实世界中多样化人群的情况。
混杂因素介导了医学影像中AI对人口统计学特征的预测。
本研究利用来自两个医疗系统的超过53万份心脏超声视频数据发现,AI模型能够预测性别(AUC 0.85)和年龄(平均误差9.12年),但除非在训练数据中人为加入年龄、性别等混杂变量,否则无法可靠预测种族。这表明AI学习的是人口统计学捷径,而非真实的疾病特征。
智利黑色素瘤:人口统计学与临床病理特征。
一项针对智利1037名黑色素瘤患者的多中心队列研究发现,其中9.3%患有肢端雀斑样痣黑色素瘤——这一亚型在浅肤色人群中较为罕见——且公立与私立医疗机构的患者生存率存在差异,凸显了需利用特定人群数据来训练和验证人工智能模型。
面向人类病理学的多模态生成式AI辅助系统
PathChat是一款基于视觉与语言的人工智能助手,经过超过45.6万条病理学特定指令的训练,在涵盖多种组织类型的多选诊断问题中表现优于GPT-4V,并获得了人类病理学家的偏好,但其在不同患者群体中的表现尚未经过专门测试。
基础模型——病理学人工智能的万能良方?
在针对前列腺癌诊断的最大规模AI验证中——涵盖11个国家15个医疗中心的7,342名患者、超过10万份活检样本——基础模型并未全面超越任务专用模型;当有足够标注数据时,任务专用模型的表现与之相当甚至更优,而基础模型的能耗则高达前者的35倍。
