WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

多模态临床AI系统对不同患者群体的处理效果如何?

多模态人工智能虽优于单模态模型,但因训练数据中的偏差及元数据处理问题,在应对多样化人群时仍存在困难。

直接答案

多模态临床人工智能系统对不同患者群体的处理存在显著差异:这类系统始终优于单模态模型(例如,GPT-4V在输入多模态信息时诊断准确率达80.6%,而仅依赖文本时仅为66.7%[1]),但在代表性不足的群体中性能急剧下降。例如,皮肤病学AI模型在不同肤色人群中的ROC-AUC值下降了27%至36%[8];一项大规模筛查研究发现,25家符合条件的供应商中仅有8家参与,且多族裔队列的处理时间从13.5小时到105天不等[2]。这些研究中最有力的证据表明,尽管多模态整合提升了准确性,但公平性和可靠性在很大程度上取决于训练数据的多样性以及元数据的审慎选择[6]

8篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

融合数据类型真的能提高不同患者的诊断准确性吗?

确实如此,但性能提升并非自动实现——它取决于数据如何整合,以及模型是否接触过多样化的案例。最有力的单一证据来自一项针对GPT-4V在93个复杂临床病例中的研究:多模态输入(文本+图像)的诊断准确率达到80.6%,而仅用文本时为66.7%,仅用图像时为45.2%[1]。这一规律在各专科中均有体现:一项涵盖432篇论文的范围综述发现,多模态AI的AUC值平均比单模态模型高出6.2个百分点[5]。在前列腺癌检测中,将基于MRI的深度学习与临床参数(PSA、年龄、前列腺体积)相结合,使AUC从0.70(仅用MRI)提升至0.77[3]。然而,这些增益只有在模型基于反映目标人群的数据进行训练时才能实现——而这正是许多系统的短板所在。

这些系统在非白人、非男性或年轻患者身上的表现如何?

证据显示出一个令人担忧的差距:对于肤色较深的患者、罕见疾病患者以及非主流人口群体,AI模型的性能显著下降。在皮肤科领域,最先进的AI模型在多样化皮肤图像数据集(首个公开的、包含不同肤色且经病理确认的图像数据集)上进行测试时,其ROC-AUC值相比原始测试结果下降了27%至36%,所有模型在深色皮肤和罕见疾病上的表现均更差[8]。一项针对糖尿病视网膜病变筛查算法的大规模评估,涉及202,886次就诊(其中32%为白人,17%为黑人,39%为南亚裔),发现25家符合条件的供应商中仅有8家同意参与,处理时间从13.5小时到105天不等,引发了实际公平性问题[2]。问题并不仅限于表面:一项涵盖皮肤科、放射科和眼科领域的公平性分析发现,不加区分地纳入所有患者元数据(如年龄、性别、肤色)实际上可能损害受保护亚群体的公平性,而谨慎选择元数据至关重要[6]。另一项法律与伦理审查警告称,在医疗AI中忽视性别差异可能导致误诊和歧视,尤其对边缘化群体而言[7]

这些偏差能否被修正,实际限制又是什么?

是的,但修复工作需要刻意的努力和透明度。皮肤病学研究发现,在多样化的DDI数据集上微调AI模型,能够缩小浅色与深色肤色之间的性能差距,且微调后的模型在识别深色皮肤恶性肿瘤方面实际优于皮肤科医生[8]。类似地,一项针对运动员心血管筛查的多模态框架采用结构化稀疏推理和运动状态嵌入,提升了不同运动员群体风险分层的准确性[4]。然而,通往公平的道路并非一帆风顺:公平性指南研究表明,若元数据未经审慎筛选,单纯增加数据模态可能适得其反——错误的元数据反而会加剧偏见[6]。一个主要的实际障碍在于,许多商业AI系统属于专有技术,导致无法审计其训练数据中的偏见[1]。本研究中规模最大的真实世界评估——糖尿病视网膜病变筛查研究——仅安装和验证算法就耗时96至460天,且仅有三分之一的合格供应商参与[2]。这表明,即便解决方案存在,规模化部署依然缓慢且不均衡。

关于这些来源

该回答基于8篇经同行评审的研究——发表于2022年至2025年间,其中5篇为2024年或之后发表,3篇发表于Q1期刊,累计被引用143次——这些研究是从10篇通过质量筛选的研究中选出的最具相关性的成果,而该10篇研究又源自从超过5亿篇论文的数据库中检索到的49篇文献。

本文引用的文献

1

评估生成式人工智能在复杂临床诊断中的多模态能力

GPT-4V在93项《新英格兰医学杂志》图像挑战中,通过多模态输入(文本+图像)达到了80.6%的诊断准确率,而仅文本输入为66.7%,仅图像输入为45.2%,但该专有模型限制了偏差审计的开展。

2

面向多样化人群的临床AI医学影像分析可信度评估

在针对糖尿病视网膜病变AI的最大规模真实世界评估中(涵盖202,886次就诊,其中32%为白人、17%为黑人、39%为南亚裔),25家符合条件的供应商中仅有8家参与,处理时间从13.5小时到105天不等。

3

结合临床与影像输入的多模态AI提升了前列腺癌检测效果。

结合MRI深度学习与临床参数(PSA、年龄、前列腺体积)的多模态AI,在外部验证中将前列腺癌检测的AUC从0.70(仅用MRI)提升至0.77。

4

面向多样化运动人群的心血管筛查与风险评估的多模态AI驱动框架:运动心脏病学领域的创新。

一种用于运动员心血管筛查的多模态人工智能框架,采用结构化稀疏推理和运动状态条件嵌入,提升了不同运动员群体中风险分层准确性。

5

多模态人工智能在医学领域的应用探索:技术挑战与临床应用的范围综述

一项对432篇多模态AI论文(2018–2024年)的范围综述发现,多模态模型在AUC指标上平均比单模态模型高出6.2个百分点,但面临的挑战包括跨部门协调以及数据集不完整。

6

构建公平的多模态医疗AI指南:基于大型视觉-语言模型

在皮肤科、放射科和眼科中,将患者元数据不加区分地纳入多模态人工智能可能会损害受保护子群体的公平性;而利用大型医学视觉语言模型谨慎选择元数据,则可缓解这一问题。

7

在医学人工智能中考虑多样性问题

一项法律与伦理审查警告称,若医疗人工智能算法未能考虑性别与生理差异,可能导致误诊和歧视,尤其对边缘化群体影响更为严重。

8

在一组多样化、精心整理的临床图像集上,皮肤科人工智能的表现存在差异。

最先进的皮肤科AI模型在多样化皮肤图像数据集上的ROC-AUC下降了27%至36%,在深色皮肤和罕见疾病上的表现更差;通过对多样化图像进行微调,这一差距得以缩小。