WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

多模态AI智能体是否具备足够的现实世界评估证据?

多模态人工智能智能体在肿瘤学和放射学领域展现出有前景的实际应用证据,但相关证据仍局限于特定场景和任务。

直接答案

是的,但证据仍然有限且不均衡。多模态AI代理已在真实临床环境中针对特定任务(如癌症生存预测和胸部X光分诊)进行了测试,并取得了令人鼓舞的结果。例如,一项针对911名癌症患者的研究显示,尽管数据杂乱且不完整,该AI仍能将患者分为风险组,其中位生存期差异高达五倍[1]。另一项前瞻性研究涉及43名放射科医生,发现AI分诊系统将假阳性率降低了27%,并将每位患者的诊断时间缩短了3分钟[2]。然而,这些成功仅限于少数癌症类型和影像学模式,且目前尚无研究评估通用型多模态代理在多样化真实世界条件下的表现。最强有力的证据来自受控的临床环境,而非代理在现实场景中可能面临的开放式、多步骤任务。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

多模态AI代理究竟有哪些真实世界证据?

最有力的真实世界证据来自两个领域:癌症预后和医学影像分诊。在肿瘤学领域,一项2026年的研究将多模态AI平台(HONeYBEE)应用于来自911名患者的真实临床数据,这些患者罹患三种癌症——胶质母细胞瘤、非小细胞肺癌和胰腺癌。数据质量参差不齐:每位患者缺失8%至47%的信息,且影像检查方案差异显著。尽管如此,该AI仍实现了0.60至0.68的一致性指数(预测准确度指标),更重要的是,它识别出了生存结局截然不同的患者群体——例如,低风险肺癌患者中位生存期为60个月,而高风险患者仅为12个月[1]。这表明AI能够从真实医院产生的这种不完整、异质性数据中提取有意义的信号。

在医学影像领域,一项2022年的研究测试了一款多模态AI助手(BreastScreening-AI),该研究涉及来自九家机构的45名临床医生,并在真实临床工作流程中展开。当临床医生使用该AI时,假阳性率降低了27%,假阴性率降低了4%,每位患者的平均诊断时间缩短了3分钟。91%的临床医生对该系统表示满意[2]。另一项2024年的前瞻性研究评估了一款AI胸部X光分诊系统,该系统在不同患者群体(涵盖不同年龄、性别、种族)中进行了测试,结果显示其在所有亚组中均保持高准确性(敏感性和特异性均超过84%),同时缩短了周转时间[3]。这些研究表明,多模态AI能够在真实临床环境中发挥作用,但它们都聚焦于特定、明确的诊断或预后任务,而非通用型“智能体”可能需要的开放式、多步骤推理。

证据在哪些方面仍有不足?

现有证据在范围和普适性上均有限。首先,这里的五项研究均集中于医学领域——具体而言是肿瘤学和放射学。目前尚无关于多模态AI智能体在自动驾驶、客户服务或机器人等其他领域的真实场景评估。其次,即便在医学领域内,任务也较为狭窄:基于结构化数据和影像数据进行生存预测[1]、人机协同的图像分类[2]、胸部X光片分诊[3]、回答多选图像挑战题[4]以及模拟临床试验资格筛选[5]。这些研究均未测试能自主执行多步骤工作流的智能体——例如收集病史、开具检查、解读结果并给出治疗建议——而这正是许多人听到"多模态AI智能体"时所设想的场景。

2024年一项对比多模态AI模型(Claude 3、GPT-4 Vision)在医学影像挑战题中表现的研究发现,虽然最先进的AI已超越人类平均准确率,但人类的集体决策仍优于所有AI模型[4]。这凸显了一个关键局限:即便是最前沿的多模态AI,在复杂诊断任务中仍不足以可靠地替代人类判断。研究还指出,GPT-4 Vision存在选择性作答现象——更倾向于回答简单问题,这引发了对其在实际部署中偏差与可靠性的担忧。此外,2021年的Trial Pathfinder研究[5]虽利用真实世界数据通过AI评估临床试验入组标准,但并未测试多模态智能体——它仅是一个数据分析框架,而非交互式智能体。因此,尽管现有证据对特定医疗应用令人鼓舞,但尚不足以支持多模态AI智能体已准备好广泛、无监督地投入实际应用的观点。

这些研究在哪些方面达成共识,又在哪些方面存在分歧?

多项研究在两点上基本达成共识。首先,多模态人工智能在融入实际工作流程后能够改善临床结果:[1]显示其可提升风险分层能力,[2]表明能减少误诊并加快诊断速度,[3]则证实其在多样化人群中保持稳定的准确性。其次,人类监督仍然至关重要——[2][4]均发现,AI辅助下的人类表现优于单独使用AI,而[4]更明确指出,集体人类判断优于最佳AI模型。这种在不同任务(预后评估、分诊、诊断)中的一致性结论,进一步印证了多模态AI是有用的工具,而非替代品。

这些研究之间并无直接冲突,但它们在测量指标和成功定义上存在差异。[1]侧重于统计预测指标(C指数、生存差异),[2][3]强调临床工作流程指标(错误率降低、时间节省、用户满意度),而[4]则是在基准测试中比较AI与人类的准确性。这些研究相互补充而非对立。唯一的张力在于[1][2]的乐观态度——它们显示AI在实际场景中表现良好——与[4]的谨慎立场形成对比,后者提醒我们AI仍落后于集体人类智慧。这并非矛盾,而是一种细微差别:AI在特定、受限的任务中(如X光分诊或基于结构化数据预测生存率)可能有用,但在开放式诊断推理方面仍逊于人类。关键在于,真实世界的证据确实存在,但具有任务特异性,尚不足以支持关于通用多模态智能体能力的广泛论断。

关于这些来源

该回答基于5篇经同行评审的研究——发表于2021年至2026年间,其中3篇为2024年及以后发表,4篇发表于Q1期刊,累计被引444次——这些研究是从通过质量筛选的5项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文数据库中检索到的33篇文献。

本文引用的文献

1

摘要1251:多模态人工智能的真实世界评估:基于基础模型驱动的多模态AI在GBM、NSCLC及PDAC中的应用。

在一项针对911名癌症患者的真实世界研究中,数据缺失率为8%至47%,多模态人工智能平台的一致性指数达到0.60至0.68,并识别出中位生存期差异高达五倍的患者群体(例如,肺癌患者中位生存期为60个月对比12个月),表明该平台能够处理混乱的临床数据。

2

BreastScreening-AI:评估用于人机交互的医疗智能代理

在一项涉及九家机构45名临床医生的研究中,用于乳腺癌筛查的多模态AI智能体将假阳性率降低了27%,假阴性率降低了4%,每位患者的诊断时间缩短了3分钟,并获得了91%临床医生的满意。

3

基于人工智能的胸片分诊系统在真实世界中的评估:一项前瞻性临床研究。

在一项针对AI胸部X光分诊系统的前瞻性临床研究中,该系统在不同患者群体(涵盖不同年龄、性别、种族)中接受了评估。结果显示,AI在所有亚组中的敏感性和特异性均保持在84%以上,并显著缩短了周转时间。

4

评估多模态AI在医疗诊断中的应用

在比较多模态AI模型(Claude 3、GPT-4 Vision)处理医学图像挑战题时,表现最佳的AI超越了人类平均准确率,但人类的集体决策优于所有AI模型,且GPT-4 Vision表现出选择性,更倾向于回答较简单的问题。

5

使用真实世界数据和人工智能评估肿瘤试验的入组标准

基于一项对61,094名肺癌患者真实世界数据的计算框架(Trial Pathfinder)研究,发现放宽限制性的临床试验入组标准,可使合格患者群体扩大一倍以上,同时略微改善风险比,这展示了一种数据驱动的试验设计方法。