WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

AI分诊聊天机器人的安全风险是否被低估了?

AI分诊聊天机器人展现出潜力,但存在高估病情严重程度的问题,可能导致过度分诊和资源紧张。人工监督至关重要。

直接答案

是的,AI分诊聊天机器人的安全风险可能被低估了,这主要是因为它们往往倾向于高估病情的紧急程度。在一项急诊科研究中,ChatGPT与医生的诊断一致性达到85.6%,但许多患者被过度分诊,可能导致不必要的急诊就诊和资源浪费[1]。另一项研究发现,虽然ChatGPT在分诊紧急程度上与眼科医生匹配率达98%,但另一款聊天机器人(必应聊天)的准确性较低,且同样存在高估紧急程度的问题[2]。综合这些高质量研究来看,一个一致的规律是:AI聊天机器人目前尚不足以可靠地替代人类临床医生的判断,尤其是在处理复杂或细微的病例时。

3篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

AI分诊聊天机器人的出错频率有多高?它们会犯哪些类型的错误?

最大的安全风险并非聊天机器人漏报紧急情况,而是它们过于频繁地“狼来了”。2025年一项针对138名急诊患者的研究显示,ChatGPT仅42.86%的情况下与最终会诊决策一致,且始终倾向于给出比会诊医生更高的紧急等级[1]。这意味着每10名患者中,聊天机器人就会将约6人转至超出实际需要的更高级别护理。这种过度分诊可能使急诊室不堪重负,延误真正重症患者的救治,同时给患者带来不必要的压力和经济负担。

一项2023年针对眼科疾病的独立研究发现,ChatGPT(基于GPT-4)在分诊紧急程度判断上的准确率达到98%,与人类医生水平相当;但另一款聊天机器人必应聊天(Bing Chat)的正确率仅为84%,且倾向于高估病情紧急程度[2]。关键结论是:不同AI模型的表现差异巨大,即便是最优秀的模型也不能盲目信任。

AI聊天机器人能否安全处理复杂或微妙的医疗案例?

根据现有证据,答案并非可靠。一项针对人工智能聊天机器人在初级医疗分诊中应用的2026年系统综述(涵盖八项研究)指出,聊天机器人存在“复杂推理能力有限、对细微症状表现处理不一致、以及无法获取非语言线索”等问题——而这些恰恰是安全分诊的核心要素[3]。换言之,聊天机器人无法观察到患者面色苍白、呼吸急促或明显痛苦等表现,而这些往往才是识别严重问题的真正线索。

同一篇综述指出,聊天机器人有时会产生“幻觉”——即言之凿凿但完全错误的信息——并且其准确性会随病例的临床复杂程度而变化[3]。急诊科的研究还发现,ChatGPT在处理中等紧急程度的病例时表现较好,但在病情极轻或极重的极端情况下可靠性较低[1]。因此,对于典型、教科书式的症状,聊天机器人或许能提供帮助;但面对任何异常或复杂的病情,使用它就像一场赌博。

这对患者和临床医生当下意味着什么?

关键在于,AI分诊聊天机器人最适合作为辅助工具,而非人类专家的替代品。三项研究均对此达成共识。急诊科研究明确指出,AI“可支持急诊分诊”,但警告其高估病情严重程度的倾向可能导致“过度分诊及资源消耗增加”[1]。眼科疾病研究发现ChatGPT表现良好,但仍建议保留人工监督[2]。而系统综述则总结道,聊天机器人分诊“最佳应用方式是作为临床医生监督下的决策支持,而非替代专业评估”[3]

对患者而言,这意味着不应依赖聊天机器人来判断是否需要紧急救治。若感到担忧,请直接就医。对医院和诊所而言,现有证据表明,至少在现阶段,部署无人工审核环节的AI分诊工具存在安全隐患。过度分诊、遗漏细微症状以及生成错误信息的风险真实存在,且尚未得到解决。

关于这些来源

该回答基于3篇经同行评审的研究——发表于2023年至2026年,其中2篇为2024年及以后发表,1篇发表于Q1–Q2期刊,合计被引78次——这些研究是从3篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的46篇文献。

本文引用的文献

1

AI在急诊科患者分诊中的安全性与准确性。

在一项针对138名急诊科患者的前瞻性研究中,ChatGPT与医生的诊断一致性达85.6%,但与最终会诊专家的一致性仅为42.86%,且始终高估病情严重程度,存在过度分诊的风险。

2

人工智能聊天机器人在眼科疾病分诊中的表现

在一项针对44个眼科病例的横断面研究中,ChatGPT(GPT-4)在98%的情况下与医生的分诊紧急程度判断一致,而必应聊天(Bing Chat)的正确率为84%,且出现了一些严重不准确的表述。

3

AI聊天机器人在初级保健分诊中的应用:一项系统综述

一项对8项研究的系统综述发现,AI聊天机器人的准确性参差不齐,在复杂推理和非语言线索方面存在困难,且有产生幻觉的风险,因此仅支持将其用作受监督的决策辅助工具。