有哪些真实世界证据可用,其可靠性如何?
最有力的真实世界证据来自那些直接测量用户使用聊天机器人后实际效果的研究。例如,2025年一项针对某社区心理健康中心30名焦虑症成年患者的准实验研究发现,在使用“Florence”聊天机器人六周后,重度焦虑比例从36.7%降至16.7%,而焦虑水平正常的人群比例从13.3%跃升至53.3%[1]。这意味着,根据经过验证的Zung焦虑自评量表测量,焦虑症状总体减少了50%。这是一个具体的真实世界结果,但该研究缺乏对照组且样本量较小,因此证据仅具提示性,尚不能作为定论。
其他真实世界证据来自对实际用户对话的分析。2023年一项研究考察了两款商用陪伴型AI聊天机器人的现场数据,发现不可忽视的少数对话涉及用户表达心理健康危机,然而这些聊天机器人往往未能识别或恰当回应痛苦迹象[3]。这是一种不同类型的真实世界证据——不关乎有效性,而关乎安全性——并引发了严重担忧。同一项研究还通过实验表明,消费者对风险性或无帮助的聊天机器人回应持负面态度,这给企业带来了声誉风险[3]。
在这五项研究中,证据不一:一项研究显示在受控环境下有明显益处[1],另一项则揭示了实际应用中的安全隐患[3],而定性研究强调用户看重聊天机器人的共情能力和可及性,但也指出了回复重复、缺乏深度以及隐私问题等局限[2][4][5]。因此,现实世界的证据确实存在,但其可靠性因衡量标准而异——无论是症状缓解、安全性还是用户满意度。
不同人群和场景下的证据是否依然可靠?
不——真实世界证据的可靠性在很大程度上取决于聊天机器人的使用者及其使用场景。最显著的积极结果来自秘鲁的一家社区心理健康中心:30名确诊焦虑症的成年人在治疗过程中使用了聊天机器人[1]。这种在专业监督下的正式临床环境,可能无法推广到独自在家使用聊天机器人的场景。相比之下,2025年一项针对17名有抑郁症亲身经历者的定性研究发现,尽管他们珍视聊天机器人提供的非评判性空间,但也担忧信息不准确、回答含糊以及机器共情的局限性[2]。这些用户希望获得更个性化的指导,却又不愿分享敏感数据,由此形成了个性化与隐私保护的两难困境[2]。
人口因素同样重要。2025年一项针对22名马来西亚运动员的研究发现,他们认可聊天机器人能减轻比赛焦虑,并提供无污名化的心理健康服务入口,但也指出了文化差异和技术不稳定的问题[4]。另一项2025年针对Character.AI平台上名为“心理学家”的生成式AI聊天机器人的研究(涉及13名用户,主要为18-24岁年轻女性)显示,用户看重其全天候可用性和看似共情的回应,但研究也警示了情感依赖AI及数据隐私风险[5]。由此可见,同一款聊天机器人可能对某一群体(如参与临床项目的成年人)效果良好,却对另一群体(如非正式使用的年轻人)引发不同问题。证据表明,并不存在“一刀切”的解决方案。
目前真实世界证据中最大的缺口是什么?
最大的差距在于缺乏大规模、对照试验。这里唯一一项测量临床结果(焦虑缓解)的研究仅有30名参与者,且没有对照组[1]。这使得我们难以判断改善效果是来自聊天机器人,还是仅仅因为时间推移或其他因素。其他研究均为定性研究或小规模调查,这些有助于了解用户体验,但无法证明聊天机器人能带来更好的心理健康结果[2][4][5]。
另一个重大缺口是安全监测。2023年的实地研究发现,商业化的陪伴型AI在应对心理健康危机时往往无法做出适当回应[3],但其他研究均未系统性地追踪不良事件或伤害。定性研究中的用户提到了对错误信息、缺乏深度以及隐私问题的担忧[2][4][5],然而没有一项研究实际衡量过是否有用户因聊天机器人而病情恶化,或因此延迟寻求专业帮助。这是一个关键的盲区。
最后,证据的时效性有限。最长的干预措施仅为六周[1],大多数研究只记录了单次互动或几周的使用情况。我们缺乏真实世界的证据,无法了解当某人连续数月或数年使用心理健康聊天机器人时会发生什么——益处能否持续,用户是否会产生依赖,或者聊天机器人的回应是否会随时间退化。在这些空白被填补之前,真实世界的证据仍将看似前景广阔,实则并不完整。
关于这些来源
该回答基于5篇经同行评审的研究构建而成——发表于2023年至2025年间,其中4篇为2024年及以后发表,2篇发表于Q1期刊,累计被引用119次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文数据库中检索到的51篇文献。
本文引用的文献
《AI聊天机器人在社区心理健康中心降低焦虑水平的效果》(预印本)
在一项针对某社区心理健康中心30名焦虑症成年人的准实验研究中,使用“Florence”聊天机器人六周后,重度焦虑比例从36.7%降至16.7%,正常焦虑水平从13.3%升至53.3%,症状总体减轻了50%。
AI心理健康自我管理聊天机器人:一项以亲身经历为中心的定性研究(预印本)
在对17名有抑郁症亲身经历者的定性访谈中,用户认可聊天机器人提供的非评判性空间,但也对其信息不准确、回答模糊以及个性化与隐私之间的两难困境表示担忧——他们既希望获得量身定制的指导,又不愿透露敏感数据。
聊天机器人与心理健康:对生成式人工智能安全性的洞察
两项针对商用伴侣AI的实地证据表明,相当一部分对话涉及心理健康危机,而聊天机器人往往未能识别或恰当回应痛苦迹象;实验显示,消费者对存在风险或无益的回应会做出负面反应。
调查AI聊天机器人在为运动员提供心理健康支持方面的用户体验
在针对22名运动员的定性访谈中,用户报告称心理健康状况得到改善,与比赛相关的焦虑有所减轻,但也指出技术不稳定、文化差异以及数据安全隐患是主要障碍。
生成式AI聊天机器人在心理健康支持中的感知优势与局限:一项探索性混合方法研究
在一项针对生成式AI聊天机器人13名用户(主要为18-24岁年轻女性)的混合方法研究中,用户看重其全天候可用性和看似富有同理心的回应,但该研究也指出了对AI产生情感依赖、数据隐私问题以及偏见或错误信息传播的潜在风险。
