WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

哪些证据缺口阻碍了AI病理模型的发展?

AI病理模型的发展受到人口统计学偏差、缺乏前瞻性验证、可解释性有限以及数据标准化不足等问题的制约。

直接答案

AI病理模型尚未具备大规模临床应用的成熟条件,主要存在几项关键证据缺口。最突出的是人口统计学偏差:模型对某些种族群体的诊断准确率可能显著偏低,部分任务中白人与黑人患者的性能差距高达16%[2]。另一重大缺口是缺乏严谨的真实世界验证——获批的AI病理产品中仅约42%发表了经同行评审的外部验证研究[5],且尚无随机前瞻性试验明确证实基于AI的诊断优于常规诊疗[4]。若未能通过多样化代表性数据及前瞻性临床试验填补这些缺口,这些模型将面临不公且不可靠的风险。

8篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何AI病理模型在某些患者群体中表现更差?

最令人担忧的证据缺口在于人口统计学偏差:基于公开数据集训练的人工智能模型对某些种族群体的准确性可能显著降低。2024年的一项研究发现,采用常见建模方法时,白人与黑人患者之间的性能差距(以受试者工作特征曲线下面积衡量)在乳腺癌亚型分类中为3.0%,肺癌亚型分类中为10.9%,而在预测胶质瘤IDH1突变时竟高达16.0%[2]。即便使用最先进的偏差缓解策略和自监督模型提供的更丰富特征表示,这些差距依然存在——尽管更丰富的模型确实缩小了差异[2]。根本原因在于,癌症基因组图谱等大型公共数据集对某些人口群体的代表性不足,导致模型从未学会识别这些群体中的疾病模式[2]。这意味着在一个医院系统中表现良好的模型,可能在患者构成不同的另一家医院中失效,直接削弱了其临床实用性和公平性。

问题不仅限于种族。同一项研究表明,性能差异还延伸至其他人口统计因素,作者明确呼吁监管机构将按人口统计分层评估纳入其评估指南[2]。若无此类要求,开发者便缺乏动力确保其模型对所有人都同样有效。

这些模型究竟经过了多大程度的真实世界测试?

第二个关键缺口在于前瞻性临床试验几乎完全缺失。一篇2021年的综述指出,在病理学领域,“尚无随机前瞻性试验证明基于AI的诊断能带来获益”[4]。截至2025年,这一情况基本未变。2024年一项针对欧洲市场上全部26种基于AI的病理学产品的调查发现,仅有10种(38%)发表了经同行评审的内部验证研究,仅11种(42%)拥有经同行评审的外部验证研究[5]。大多数产品通过无需独立测试的自我认证途径获得监管批准[5]。这意味着,对于绝大多数商业AI病理学工具而言,其使用证据来自开发者自身,而非利用真实世界临床数据进行研究的独立研究人员。

现有的少数研究多为回顾性研究,利用存档的组织样本和已知结果进行分析。例如,2023年一项大型研究开发了AI模型,基于多中心回顾性数据预测肝癌患者的治疗反应,模型预测结果与实际分子特征的相关性达到r=0.62[1]。尽管这一成果令人鼓舞,但与前瞻性试验仍有巨大差距——在前瞻性试验中,模型的预测结果将用于指导实时治疗决策。研究者也指出,外部验证和前瞻性验证正在进行中[3]。在这些试验完成并发表之前,临床医生无法确信这些模型在日常实践中能达到预期表现。

病理学家能信任他们无法理解的“黑箱”吗?

第三个差距在于深度学习模型的可解释性有限。许多AI病理系统如同“黑箱”,能给出诊断或风险评分,却无法展示其推理过程。这成为临床推广的主要障碍,因为病理学家需要理解模型为何做出特定判断,才能信任它并发现错误。2023年的一篇综述专门探讨了这一问题,指出可解释AI——即让机器学习决策更透明的方法——对于精准病理学至关重要[7]。缺乏可解释性,病理学家可能要么盲目接受错误的AI建议,要么拒绝有用的建议,这两种情况都极其危险。

问题更为复杂的是,AI模型可能具有“脆弱性”——它们在训练数据上表现良好,但面对略有差异的图像(例如来自不同扫描仪或染色方案的图像)时则可能失效[8]。2025年的一篇综述指出,挑战包括“可解释性有限、数据偏差、缺乏前瞻性试验以及监管障碍”[6]。在模型能够清晰展示哪些特征(例如特定细胞形态、组织模式)驱动其决策之前,病理学家对依赖它们进行患者诊疗保持谨慎是完全合理的。

关于这些来源

该答案基于8篇同行评审研究构建而成——发表于2021年至2025年间,其中4篇为2024年及以后发表,6篇发表于Q1期刊,累计被引用480次——这些研究是从15篇通过质量筛选的文献中选出的最具相关性的成果,而该15篇文献又源自从超过5亿篇论文数据库中检索到的72篇论文。

本文引用的文献

1

基于人工智能的病理学作为肝细胞癌患者对阿替利珠单抗-贝伐珠单抗敏感性生物标志物的多中心回顾性研究

一项2023年多中心回顾性研究开发了一种人工智能模型(ABRS-P),用于预测接受阿替利珠单抗-贝伐珠单抗治疗的肝癌患者的无进展生存期。该模型预测结果与训练集中分子特征的相关性为r=0.62,在外部活检验证集中为r=0.53。

2

计算病理学模型误诊中的人口统计学偏差

一项2024年的研究发现,全切片图像分类模型在不同人口群体间表现出显著的性能差异:在乳腺癌亚型分类中,白人与黑人患者之间的差距为3.0%;肺癌亚型分类中为10.9%;而在胶质瘤IDH1突变预测中,这一差距达到16.0%。

3

在NRG/RTOG试验中,开发并验证了一种基于多模态人工智能(MMAI)的数字病理学生物标志物,用于预测根治性前列腺切除术后出现生化复发患者的转移风险。

一项2025年的研究开发了一种多模态人工智能模型,用于预测前列腺癌患者接受根治性前列腺切除术后的远处转移情况,该模型在10年时间依赖性AUC上达到0.74,而临床列线图为0.68,但研究指出外部验证和前瞻性验证仍在进行中。

4

病理学中的人工智能

一篇2021年的综述指出,目前尚无随机前瞻性试验证明基于人工智能的病理诊断具有益处,虽然已有初步的概念验证研究,但这些研究仍需通过前瞻性试验加以证实或证伪。

5

关于数字病理学中人工智能产品的公开证据

一项2024年针对欧洲市场上26款基于人工智能的病理学产品的审查发现,仅有10款(38%)拥有经同行评审的内部验证研究,11款(42%)拥有经同行评审的外部验证研究;大多数产品通过自我认证获得了监管批准。

6

《临床医学中的人工智能:诊断影像、临床决策支持、外科、病理学及药物研发领域的挑战》

一项涵盖五个医学领域、对150项研究进行的2025年综述指出,人工智能在诊断影像方面表现优异(AUC最高达0.94),但仍面临可解释性有限、数据偏差、缺乏前瞻性试验以及监管障碍等挑战。

7

面向精准病理学的可解释人工智能

一篇2023年的综述阐述了传统人工智能“黑箱”特性的局限性,并指出可解释人工智能对于提升精准病理学中机器学习决策的透明度至关重要。

8

病理学中的AI:可能会出什么问题?

2023年的一篇综述讨论了人工智能病理学应用面临的挑战,包括存在隐性偏见的非代表性训练数据、数据隐私问题、算法脆弱性,以及可能导致从业者技能退化和职业倦怠的风险。