AI病理模型究竟拥有哪些前瞻性临床证据?
最有力的前瞻性证据来自一项关于AI数字病理平台用于代谢功能障碍相关脂肪性肝炎(MASH)肝纤维化评分的随机交叉试验。当四位专家病理学家使用该AI工具时,他们对哪些患者符合临床试验入组条件(纤维化F2-F3期)的判定一致性从45%跃升至71%——提升了26个百分点[1]。该工具还将专家裁定需求减少了约25%,并使统计研究效能提高了约50%[1]。这是一项设计严谨、具有明确临床终点的前瞻性研究。
另一项前瞻性研究将AI骨折检测系统整合到了放射影像的临床工作流程中。住院医师独自阅片时发现了84.7%的骨折,但在参考AI分析结果后,其敏感度提升至91.3%——即在总共367处骨折中多发现了25处,且特异性未受影响(97.4%对比97.1%)[2]。这表明AI能够在实时临床环境中直接提升诊断准确性。
然而,一项针对欧洲市场上26款基于人工智能的数字病理学产品的全面审查发现,仅有10款(38%)拥有经过同行评审的内部验证研究,而只有11款(42%)具备外部验证研究[5]。大多数产品(26款中的24款)通过自我认证作为通用体外诊断设备获批,这意味着它们无需提供严格的临床试验数据即可进入市场[5]。这种现有产品与经过前瞻性测试的产品之间的差距,是一个重大隐忧。
其他医学影像领域的AI模型是否有更充分的证据?
是的,有些研究确实如此。一项基于人工智能的心脏磁共振成像规划与匀场技术的前瞻性研究显示出了切实的改进:与标准方法相比,AI系统将扫描时间缩短了约13%(超过2分钟),并将图像信噪比提升了12.5%[3]。该研究招募了30名受试者(10名用于规划,20名用于匀场),并在真实的临床MRI扫描仪上进行[3]。这里的证据具有前瞻性,并展示了明确的操作优势。
然而,即便在这一较为成熟的领域,仍需保持谨慎。针对一项由麻省理工学院与OpenAI联合开展的高知名度AI治疗聊天机器人随机对照试验,有评论指出,尽管该研究设计严谨,但早期发现的负面效应在统计上并不稳健[4]。作者呼吁不要过度解读初步结果,强调“由于关键分析方法的局限性,这些发现并不能证实存在有害影响的论断”[4]。这提醒我们,即便是备受关注的AI研究,也需要经过重复验证和严格审视。
对于考虑使用AI病理工具的临床医生,关键结论是什么?
证据令人鼓舞,但尚不均衡。在肝纤维化分期或骨折检测等特定任务中,前瞻性研究显示准确性和效率均有显著提升——临床试验入组的一致性提高了26个百分点[1],骨折检测灵敏度提升了6.5个百分点[2]。这些进步不容小觑。
然而,目前市场上大多数AI病理产品缺乏已发表的前瞻性验证[5]。临床医生在采用某项工具前应提出两个问题:(1)该工具是否已在模拟您临床工作流程的前瞻性研究中得到测试?(2)该研究是否已被独立重复验证?证据基础正在积累,但尚未普及。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2022年至2025年间,其中3篇为2024年及以后发表,4篇发表于Q1期刊,合计被引用69次——这些研究是从通过质量筛选的5项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文数据库中检索到的55篇文献。
本文引用的文献
AI数字病理学作为辅助病理学家评估MASH纤维化分级的实用性
在一项针对两项MASH临床试验中120张切片的随机交叉试验中,AI辅助将病理学家之间识别F2-F3纤维化患者的一致性从45%提升至71%,并据模型估算,可将裁定需求减少约25%,同时将研究效力提高约50%。
将AI骨折检测软件集成到放射影像临床工作流的前瞻性方法
在一项将AI骨折检测前瞻性整合至临床工作流程的研究中(共1163次检查,367处骨折),AI辅助将住院医师的敏感性从84.7%提升至91.3%,且未降低特异性(97.4%对比97.1%)。
基于人工智能的心脏MRI规划与匀场技术的实施及前瞻性临床验证。
在一项基于人工智能的心脏磁共振成像规划与匀场的前瞻性研究(30名受试者)中,与传统方法相比,人工智能将扫描时间缩短了约13%,并将左心室信噪比提升了12.5%。
在AI疗法中平衡希望与担忧:基于MIT–OpenAI随机对照试验早期证据的批判性视角
一篇针对MIT-OpenAI关于AI治疗聊天机器人随机对照试验的评论文章指出,由于关键分析方法的局限性,早期关于有害影响的说法缺乏依据,并呼吁在解读初步研究结果时保持谨慎。
关于数字病理学中人工智能产品的公开证据
一项针对欧洲市场上26款AI数字病理产品的审查发现,仅10款(38%)拥有经同行评审的内部验证,11款(42%)具备外部验证;大多数产品通过自我认证获批,缺乏严格的临床试验数据支持。
