WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

医学基础模型是否具备足够的临床前瞻性证据?

医学基础模型的前瞻性临床证据极为稀缺,目前仅有一项随机对照试验,该试验表明眼科辅助系统具有显著获益。

直接答案

不,大多数医学基础模型仍缺乏可靠的前瞻性临床证据。在本次综述的研究中,仅有一项随机对照试验(RCT)已完成——名为EyeFM的眼科辅助系统——结果显示,使用该系统的眼科医生正确诊断率为92.2%,而未使用的医生仅为75.4%[1]。绝大多数其他模型仅经过回顾性验证或在小规模、单中心研究中测试,且不到5%的病理基础模型研究开展了前瞻性试验[7]。因此,尽管这些模型在受控环境下的技术表现往往十分出色,但证明其能改善真实世界患者预后的证据仍然非常薄弱。

7篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

唯一最有说服力的前瞻性证据是什么?

任何医学基础模型中最有力的前瞻性临床证据,来自一项针对名为EyeFM的眼科辅助系统的随机对照试验(RCT)[1]。这项双盲、平行分组研究将668名参与者随机分配给16名眼科医生,其中一半医生使用EyeFM辅助系统,另一半提供标准诊疗。主要终点结果令人瞩目:使用辅助系统的眼科医生正确诊断率达92.2%,而对照组为75.4%——提升了16.8个百分点。转诊率同样有所改善(92.2% vs. 80.5%),且干预组患者在随访中遵循自我管理建议的比例更高(70.1% vs. 49.1%)。这是本次审阅论文中唯一的随机对照试验,直接证明了基础模型能在真实筛查场景中提升临床医生表现并改善患者预后。

除了那项试验,还有多少证据存在?

除该单项随机对照试验外,现有证据几乎完全基于回顾性研究或实验室数据。一项关于围产期医学中人工智能的系统综述发现,在纳入的36项研究中,所有研究均为回顾性、单中心或缺乏外部验证,且无一提供前瞻性影响数据[4]。同样,另一项针对数字病理学基础模型的系统综述指出,仅不到5%的研究为前瞻性设计,仅14.3%的研究开展了多中心验证[7]。即便在这些论文中规模最大的病理学基础模型——基于10万名患者150万张全切片图像训练的Virchow模型——其评估仍基于回顾性数据集,而非前瞻性临床工作流程[5]。癌症影像生物标志物模型也呈现相同模式:一个基于11467个放射影像病灶训练的基础模型在回顾性任务中表现优于传统方法,但未见前瞻性试验报道[6]。因此,尽管技术基准令人瞩目,但在存储数据上表现优异的模型与真正实时改善患者护理的模型之间,仍存在巨大鸿沟。

有哪些模型展现出超越随机对照试验的临床实用性?

少数研究提供了证据,表明基础模型能在特定任务中提升临床医生的工作效率或准确性,尽管这些研究并非完整的前瞻性试验。例如,一款名为LEADS的文献挖掘基础模型在16名临床医生和研究人员参与的用户研究中接受了测试:使用LEADS的受试者召回率达到0.81,而未使用时为0.78,同时在研究筛选环节节省了20.8%的时间[2]。在数据提取方面,准确率从0.80提升至0.85,并节省了26.9%的时间。这是一项对照实验而非临床试验,但它展示了在实际工作流程中可量化的效益。在病理学领域,一个用于量化肿瘤浸润淋巴细胞(TILs)的框架在“前瞻性部署式试点”中接受了测试,每张切片处理仅需2.3分钟——比人工评分快87%——且与病理学专家结果高度一致(皮尔逊相关系数r=0.879)[3]。不过,该试点并非针对患者结局的随机对照比较。这些案例表明,基础模型能在特定任务中增强人类表现,但现有证据远不足以证明它们能改善整体临床护理质量。

关于这些来源

该回答基于7篇经同行评审的研究——发表于2024年至2026年间,其中7篇为2024年或之后发表,2篇发表于Q1期刊,累计被引443次——这些研究是从9篇通过质量筛选的文献中选出的最具相关性的成果,而该9篇文献又源自从超过5亿篇论文数据库中检索到的74篇论文。

本文引用的文献

1

用于临床辅助的眼科基础模型:一项随机对照试验。

在这些论文中唯一一项随机对照试验显示,针对668名高风险筛查人群,眼科辅助系统(EyeFM)将眼科医生的正确诊断率从75.4%提升至92.2%,转诊率从80.5%提升至92.2%。

2

用于医学文献挖掘中人类与AI协作的基础模型

一项文献挖掘基础模型(LEADS)在16名临床医生参与的用户研究中得到验证:在文献筛选环节,召回率从0.78提升至0.81,同时节省20.8%的时间;在数据提取环节,准确率从0.80提升至0.85,并节省26.9%的时间。

3

基于人工智能的T淋巴细胞浸润量化方法,通过深度学习和统计验证预测高级别乳腺癌的预后。

用于乳腺癌TIL定量分析的AI框架在内部测试中达到了94.7%的准确率,在外部队列中分别为92.1%和91.3%,一项前瞻性试点研究显示,与人工评分相比,评估时间减少了87%。

4

围产期医学中的人工智能:当前应用、局限性的系统综述及基础模型时代的转化路线图

一项关于围产期医学中人工智能的系统综述发现,在纳入的36项研究中,所有研究均为回顾性或单中心研究,缺乏前瞻性影响评估;该综述提出了分阶段转化的路线图。

5

一个面向临床级计算病理学与罕见癌症检测的基础模型

Virchow是一个基于病理学的基础模型,在来自10万名患者的150万张全切片图像上训练而成,在涵盖16种癌症类型的泛癌检测中达到了0.95的AUC,但该模型仅在回顾性数据集上进行了评估。

6

癌症影像生物标志物的基础模型

一个针对癌症影像生物标志物的基础模型,在11,467个放射学病灶上训练后,在下游任务中表现优于传统监督方法,尤其在训练数据有限的情况下更为突出,但尚未有前瞻性试验的报道。

7

数字病理成像中的基础模型与AI智能体:临床工作流整合及实施挑战的系统性综述

一项关于数字病理学基础模型的系统综述发现,在纳入的42项研究中,前瞻性研究占比不足5%,仅14.3%的研究开展了多中心验证;同时,研究指出了四项实施障碍。