AI与放射科医生单独工作相比表现如何?
规模最大、最全面的研究涉及20名放射科医生和超过2500张胸部X光片,结果显示,在124项临床发现中,AI模型单独诊断的准确率在117项(94%)上显著高于未辅助的放射科医生,其余发现也非劣于后者[2]。AI的宏观平均曲线下面积(AUC)为0.957,而未辅助放射科医生仅为0.713,差距悬殊[2]。然而,一项涵盖11个国家204名放射科医生的国际读者研究得出了相反结论:放射科医生的总体AUC(0.96 vs. 0.87)和灵敏度(0.91 vs. 0.71)均高于AI[1]。关键区别在于,第一项研究测试了AI在127项非常广泛的发现上的表现,而第二项研究则使用了更常规、通用的数据集。因此,AI在特定、明确的任务上可以超越放射科医生,但在常规、非选择性病例中,放射科医生仍保持优势。
AI能否帮助放射科医生做得更好?
是的,证据充分且一致。在同一项大型研究中,当放射科医生将AI作为决策支持工具时,他们在127项发现中有102项(80%)的准确性显著提升,且未发现任何一项准确性下降[2]。另一项涉及8名放射科医生的研究表明,参考深度学习模型后,他们区分COVID-19与其他肺炎的能力显著提高(p = 0.0038)[8]。一项独立研究显示,无论是放射科医生还是非放射科医生,在使用经FDA批准的AI系统辅助后,胸部X光异常检测能力均显著提升,其中非放射科医生在使用AI后达到了与放射科医生相当的准确性[4]。AI还能捕捉错误:在一项涵盖279例漏诊或误诊病例的多中心研究中,AI以96%的敏感性和100%的特异性检测出这些错误[5]。这些研究一致表明,AI始终充当着安全网的角色,捕捉人类遗漏的问题,并全面提升诊断准确性。
AI 在哪些方面仍有不足?
人工智能并非完美无缺,相关证据揭示了其若干局限性。首先,AI在处理微小或复杂病变时存在困难:一项针对显著性方法(用于显示AI的"关注区域")的基准测试发现,所有七种方法在定位病变方面的表现均显著逊于人类专家,尤其对于体积较小、形状不规则的病灶[7]。其次,AI可能存在偏差:一项研究显示,在大型公共数据集中,诊断AI对少数族裔群体的假阴性率更高,但通过过采样和数据增强技术,这一差异最多可降低74.7%,且不影响整体性能[9]。第三,在居家医疗场景中,AI与放射科医师的诊断一致性仅为中等水平(kappa=0.49),研究者认为AI在临床使用前仍需进一步改进[6]。最后,尽管AI在准确性上可与经验不足的放射科医师媲美甚至更优,但与资深专家相比仍存在整体差距[1][3]。结论是:AI是强大的工具,但尚无法完全替代人类专家的判断。
关于这些来源
该答案基于9篇经同行评审的研究——发表于2021年至2025年间,其中4篇为2024年及以后发表,6篇发表于Q1期刊,累计被引449次——这些研究是从11篇通过质量筛选的文献中选出的最具相关性的成果,而该11篇文献又源自一个包含超过5亿篇论文的数据库中所检索到的47篇论文。
本文引用的文献
一项针对常规放射学病例中人工智能基准测试的国际非劣效性研究:胸部X光、荧光摄影与乳腺摄影
在一项纳入204名放射科医生的国际读者研究中,人工智能的AUROC(0.87 vs. 0.96)和灵敏度(0.71 vs. 0.91)均低于放射科医生,但在胸部X光片判读方面不劣于经验最少的放射科医生,这表明人工智能可用于初筛以减轻工作负担。
深度学习综合模型对放射科医师胸部X光片判读准确性的影响:一项回顾性、多读者多病例研究
在一项大型多读者研究(20名放射科医生,2568个病例)中,仅凭AI对124项发现中的94%显著优于未受辅助的放射科医生(AUC 0.957 vs. 0.713),而当AI作为决策支持工具时,它提升了放射科医生对80%发现的准确性。
比较多个国家的计算机辅助检测(CAD)软件与放射科医生在胸部X光片中检测结核病的准确性。
在对比12款CAD软件与来自四个国家的11名放射科医生对774张胸部X光片的诊断表现时,表现最佳的CAD软件在特异性匹配方面超越了除印度放射科医生外的所有医生,而英国放射科医生的灵敏度则最接近该顶级CAD软件。
深度学习提升了医生在胸部X光片综合异常检测中的准确性。
一项获得FDA批准的AI系统(AUC 0.976)显著提升了医生的诊断准确率(AUC差值0.101,p<0.001),使用该AI的非放射科医生在准确率上与放射科医生相当,且速度更快。
一项关于胸部X线摄影AI算法在检测遗漏或误标发现中表现的多中心研究
在一项针对279张存在漏诊或误标发现的胸部X光片的多中心研究中,一种人工智能算法以96%的灵敏度、100%的特异性和96%的准确率检测出这些错误,显示出减少放射科医生失误的潜力。
放射科医生、内科专家与AI软件在居家医院服务中对胸部X光片判读的一致性:一项前瞻性观察研究。
在居家医院服务中,人工智能与放射科医生之间的一致性为中等(kappa=0.49),而内科专家与放射科医生之间的一致性则较高(kappa=0.65),这表明人工智能在临床应用中仍需进一步发展。
为胸部X光解读中的显著性方法进行基准测试
对七种显著性方法(包括Grad-CAM)与人类专家基准的对比评估发现,所有方法在定位病理区域方面表现显著较差,尤其是针对较小且形状更复杂的病灶;同时,模型置信度与定位性能呈正相关。
放射科医生在有和没有深度学习系统辅助下,对胸部X光片进行计算机辅助诊断以识别COVID-19的外部验证研究
一种用于COVID-19的深度学习模型在诊断性能上优于大多数放射科医生(准确率0.733对比0.696),并且当作为参考使用时,显著提升了放射科医生的表现(p=0.0038)。
提升胸部X光分类中AI公平性的增强
在MIMIC-CXR数据集中,AI对少数族裔的假阴性率更高;通过过采样技术,这一差异减少了74.7%,且性能未下降(AUC 0.816-0.820对比基线0.810-0.819)。
