AI放射学辅助系统在不同患者群体中的表现如何?
最有力的证据表明,AI辅助系统在多种组织类型和疾病中均能表现出色,但其成功高度依赖于训练数据的多样性。2024年一项研究中,PathChat AI辅助系统基于超过45.6万条涵盖不同组织来源和疾病模型的视觉语言指令进行训练,在多项选择题诊断任务中达到了最先进水平[1]。这意味着它处理多种组织与疾病相关问题的能力优于其他AI系统。然而,同一研究指出,该系统专门针对病理学进行了微调,因此其在放射影像(如CT或MRI)上的表现并未直接测试[1]。
2021年的一项生物医学人工智能分析研究广泛指出,算法通常基于非代表性样本开发,这可能导致对训练数据中代表性不足的群体产生偏差结果[3]。这意味着,如果一款AI放射学辅助工具主要基于某一族裔或某一类型医院的图像进行训练,那么对于来自其他背景的患者,其准确性可能会降低。作者建议收集更多样化的数据,并监测人工智能在不同亚组中的表现,以发现差异[3]。
不同成像模态和身体部位呢?
AI辅助工具正在开发中,以处理多种影像类型,但证据表明其性能因成像方式和身体部位而异。2024年的一项项目为11种不同的癌症影像数据集生成了AI标注,涵盖CT、MRI和PET扫描,涉及胸部、乳腺、肾脏、前列腺和肝脏等身体部位[2]。AI能够针对这些多样的成像方式和身体部位生成分割结果,表明它可以处理多样化的输入。然而,同一研究指出,原始DICOM数据中仅有4%的影像已有分割标注,这意味着AI是从非常稀疏的起点开始工作的[2]。一位放射科医生对部分AI标注进行了审查和修正以评估其性能,这表明AI的原始输出并非总是足够准确,无法不经人工核查直接使用[2]。
这与2021年分析中更广泛的担忧一致:即使人工智能在多种模态下运行,如果训练数据未能充分代表其在实际应用中可能遇到的所有变化,其准确性也可能参差不齐[3]。
无论背景如何,患者能否同等信任AI诊断报告?
患者对AI诊断报告的信任程度并非一致——这取决于患者的健康素养以及AI解释其诊断结果的方式。2023年的一项研究发现,不同健康素养水平的患者对AI诊断报告的信任程度存在差异,且他们查看报告的方式(通过眼动追踪测量)也有所不同[4]。具体而言,AI提供的解释类型(全局性解释与局部性解释)会影响信任度,且这种影响因患者的健康素养水平而异[4]。这意味着,即使AI辅助系统的技术准确性很高,不同背景的患者也可能对其产生不同程度的信任,进而影响他们根据诊断结果采取行动的方式。该研究建议,AI诊断工具需要根据用户特点调整其解释方式,以建立恰当的信任[4]。
这一发现为技术挑战增添了人性维度:多样化的患者群体带来了不同的期望与理解,人工智能辅助系统必须考虑到这些差异,才能真正发挥作用。
关于这些来源
该回答基于4篇经同行评审的研究构建而成——发表于2021年至2024年间,其中2篇为2024年或之后发表,2篇发表于Q1期刊,累计被引用411次——这些研究是从4篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文数据库中检索到的48篇论文。
本文引用的文献
用于人类病理学的多模态生成式AI辅助系统
PathChat,一款面向病理学的视觉语言AI辅助系统,基于超过45.6万条多样化的视觉语言指令进行训练,并在涵盖多种组织来源和疾病模型的多项选择题诊断任务中达到了业界领先水平,不过该系统并未专门针对放射影像进行测试。
面向NCI影像数据共享库中多样化癌症放射学集合的AI生成标注数据集
针对11个癌症影像数据集(涵盖CT、MRI、PET,涉及胸部、乳腺、肾脏、前列腺和肝脏)生成了AI标注,但原始研究中仅有4%存在现成的分割结果,且部分AI输出需要放射科医生审核修正。
确保生物医学人工智能惠及多元人群
生物医学人工智能算法通常基于非代表性样本开发,这可能导致偏差和健康差异;作者建议在更多样化的数据收集和跨亚组监测方面加强工作。
AI诊断报告解读类型对患者信任度的影响与预测
患者对AI诊断报告的信任程度因健康素养和提供的解释类型(全局解释与局部解释)而异,这一结论通过眼动追踪和问卷调查得出,表明AI辅助系统必须针对不同用户定制解释方式。
