多模态AI在哪些环节最能减轻工作负担?
最大的工作量削减来自于对重复性、高容量任务的自动化,例如图像判读和报告撰写。在乳腺癌筛查中,一套AI分诊系统能够自动读取最不具可疑性的乳腺X光片和断层合成检查结果,使放射科医生的阅片时间减少了高达72.5%——从处理15,987例检查所需的568小时降至156小时——同时保持了非劣效的癌症检出率(113例癌症中检出95例,而双人阅片检出92例),甚至还将召回率降低了16.7%[2]。类似地,一套用于上消化道内镜检查的AI系统(Report-Angel)能在每个病灶1.5秒内自动生成报告草稿,在前瞻性数据集中实现了79-83%的临床可接受报告率和89-92%的病灶级准确率[1]。这些并非微小的改进:在相同临床工作量的情况下,它们每天能为临床医生节省数小时的时间。
在淋巴瘤影像分析中,一款用于PET/CT扫描代谢肿瘤体积分割的AI模型,在公开基准数据集上(该数据集特意纳入了具有挑战性的病例)与专家阅片者的匹配率达到83%(60例中50例)[5]。该AI无需任何用户交互即可完成分割,这有望大幅减轻核医学医师目前逐层勾画肿瘤轮廓的繁重手动工作。然而,同一研究指出,仍需人工监督以尽量减少其余病例中的错误[5]。
AI在哪些情况下仍需人类参与?
即便是性能最优的AI系统,也无法完全消除错误,且其失败模式具有可预测性,仍需人工监督。在内窥镜研究中,Report-Angel生成的临床可接受报告占比为79%-83%,这意味着约五分之一的报告仍需临床医生修正[1]。在乳腺癌筛查中,AI分诊策略将工作量减少了72.5%,但仍漏检了113例癌症中的18例(16%)——不过这一结果在统计学上不劣于双人阅片标准(后者漏检21例)[2]。淋巴瘤分割AI在83%的病例中与专家水平相当,但在其余17%的病例中,AI的偏差超出可接受范围;其中10例里有4例,AI与至少一位专家阅片者的判断仅部分一致[5]。
错误的类型同样至关重要。在一项关于AI评估牙冠制备的研究中,一个模型(Claude-3.7-Sonnet-Reasoning)与人类专家表现出极佳的一致性(组内相关系数为0.89),但其他模型的一致性从弱到无不等(GPT-4o:0.06;o3:-0.03),而两个DeepSeek模型甚至完全无法完成任务[3]。这凸显出并非所有多模态AI系统都同样可靠——性能因模型架构和任务不同而差异显著。痴呆症护理框架论文的作者认为,混合AI系统——将统计学习与明确的临床知识及临床医生监督相结合——对于弥合基准性能与现实世界安全性之间的差距至关重要[4]。在这五项研究中,一致的结论是:当AI被用作增强而非取代人类判断的工具时,其减轻工作负担的效果最佳。
关于AI与工作负载,我们还有哪些未知?
现有证据虽具前景,但范围有限。多数研究为回顾性或前瞻性单中心验证,而非涵盖不同医院和患者群体的大规模随机对照试验。其中规模最大的乳腺癌筛查研究[2]和内镜研究[1]均是在特定筛查项目(分别位于西班牙科尔多瓦和中国多家医院)中开展的——若设备、患者人口学特征或放射科医生经验水平不同,结果可能有所差异。淋巴瘤分割研究[5]仅使用了包含60例病例的公开基准数据集,样本量过小,难以广泛推广。所有研究均未直接测量临床医生的职业倦怠、每日节省时间或成本效益,仅采用了阅读时间或报告生成速度等替代指标。痴呆症护理框架论文[4]明确呼吁开展更注重实用性的评估,优先关注采纳率、安全性、公平性、工作负荷及患者结局,而非仅关注基准测试准确率。在完成此类研究之前,“人工智能能否在不增加错误的前提下减轻工作负担”这一问题的答案,仍是对特定任务的有限肯定,而非适用于所有临床场景的全面背书。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2021年至2026年间,其中4篇为2024年及以后发表,2篇发表于Q1期刊,累计被引用169次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的63篇文献。
本文引用的文献
面向自动化内镜报告的多领域多模态大语言模型及多中心前瞻性验证。
在一项多中心前瞻性验证中,用于上消化道内镜检查的Report-Angel多模态人工智能系统生成的报告草稿临床可接受率为79%-83%,病灶级准确率为89%-92%,平均每个病灶处理时间为1.5秒,表明其具有减轻内镜医师工作负担的潜力。
基于人工智能的策略在乳腺X线摄影和断层合成筛查中减少工作负荷:一项回顾性评估
在一项对15,987例乳腺癌筛查检查的回顾性评估中,人工智能分诊策略将放射科医生的工作量减少了高达72.5%(从568小时降至156小时),同时保持了非劣效的癌症检出率(在113例癌症中检出95例对比92例),并将召回率降低了16.7%。
多模态人工智能评估临床前不锈钢冠预备体可靠性的比较研究:与人类专家的对比分析
在一项针对133例牙冠预备体的横断面研究中,一种多模态AI模型(Claude-3.7-Sonnet-Reasoning)与人类专家表现出高度一致性(ICC=0.89),但其他模型的一致性从弱到无不等,且有两个DeepSeek模型未能完成任务。
超越黑箱式人工智能:面向痴呆症护理的可解释混合系统
本观点性文章认为,需要将统计学习与显性临床知识及临床医生监督相结合的混合人工智能系统,以弥合当前限制基础模型在痴呆症护理中应用的可解释性与可靠性差距。
使用公共基准PET/CT数据集验证一种用于自动淋巴瘤代谢肿瘤体积分割的人工智能方法。
在一项针对60例淋巴瘤PET/CT扫描的公开基准数据集的验证中,AI分割模型在83%的病例(50/60)中与专家判读结果一致,另有4例部分一致,但作者强调仍需人工监督以最大限度减少错误。
