“什么是‘锯齿状前沿’,它为何让过度自信变得危险?”
“锯齿状前沿”描述了人工智能表现的不均衡性:它既能出色完成人类觉得困难的任务,也可能在人类认为简单的事情上栽跟头,甚至在同一工作流程中也是如此。这种不可预测性并非随机——它遵循着用户往往难以掌握的规律。这一概念在波士顿咨询公司对758名顾问进行的大规模实地实验[3]中得到验证:实验表明,在AI能力范围内的任务中,AI辅助帮助员工多完成12.2%的任务,速度提升25.1%,且质量更高;但对于一项超出该范围的复杂管理任务,使用AI的顾问得出正确解决方案的可能性反而比未使用者低19%。这意味着过度自信——即误以为AI总能提供帮助,实则适得其反——会直接降低绩效。
一项独立的组织研究[2]证实了这种模式在现实环境中的存在,指出人工智能在某些知识任务上会降低结果质量,而在其他任务上则有所提升。危险在于,用户看到人工智能在许多任务上取得成功,可能会认为它无所不能,从而未能识别出那些它不可靠的任务。这种参差不齐的能力边界使得过度自信尤为危险,因为失败并不明显——它们可能发生在那些看似与人工智能擅长处理的任务相似的任务上。
AI评估能否帮助用户校准信任?
根据证据,答案并不确定。一项包含577名参与者的预注册实验[1]测试了在简单任务与困难任务中展示AI错误是否会影响用户对AI的依赖程度。研究人员原本预期,简单任务中的错误(违背了人们对AI能力的预期)会比困难任务中的错误更显著地降低用户使用率。然而,他们发现,观察到更多错误总体上会减少使用,但简单任务中的错误并未比困难任务中的错误更显著地降低使用率。这表明,人们并不会自然而然地学会这种“锯齿状模式”——他们要么整体上变得更加谨慎,要么在关键地方不够谨慎。
在医学领域,一项针对14名产科住院医师使用ChatGPT的研究[6]发现,用户自我评估的AI技能与其获得的AI回答准确性之间并无关联。这些住院医师具备中等水平的IT能力,但AI素养较低,由于对医学术语缩写的误解,他们提出的问题仅产生了21%的准确回答。尽管如此,AI的回答听起来却似乎合理——这正是“随机鹦鹉”现象的体现。这意味着,即使用户自认为在评估AI的输出,也可能因其流畅性而受到误导。仅凭评估,而不进行结构化的AI素养培训,无法防止过度自信。
AI模型自身是否知晓其能力边界?
不——前沿模型往往对自己的能力过度自信。一项关于大语言模型自我认知的研究[4]发现,即便是GPT-4o和Mistral Large这样的先进模型,也有超过80%的时间无法确定自身能力,这意味着它们缺乏可靠的自我意识。这些模型会根据任务类别在过度自信和保守之间摇摆,其最大弱点在于时间感知和语境理解能力。这种内在的混乱导致模型无法可靠地预判自己何时可能出错。
另一项研究[5]测试了大语言模型能否预测自身在任务中的成功率,结果发现所有被测试的模型都存在过度自信的问题。较新、较大的模型在辨别能力上并未普遍提升——它们并不更擅长预判自身何时会失败。在多步骤的智能体任务中,随着模型逐步推进,过度自信的问题反而加剧。当在上下文中提供失败经验时,部分模型减少了过度自信并改进了决策,但另一些模型则没有。这表明,即使系统中内置了评估机制,模型本身也可能无法从中学习,除非经过明确训练。其启示在于,无论是人类还是模型自身进行的前沿AI评估,都无法根治过度自信——必须将其与结构化工作流程、人类判断训练以及能够应对“锯齿状前沿”的系统设计相结合。
关于这些来源
该答案基于6篇经同行评审的研究——发表于2024年至2026年,其中6篇为2024年或之后发表,1篇发表于Q1–Q2期刊,累计被引用104次——这些研究是从7篇通过质量筛选的研究中选出的最相关成果,而7篇研究又源自从超过5亿篇论文的数据库中检索到的36篇文献。
本文引用的文献
生成式人工智能错误对不同任务难度下用户依赖度的影响
在一项包含577名参与者的预注册实验中,观察到更多AI错误会降低使用率,但简单任务中的错误并未比困难任务中的错误更显著地减少使用,这表明人们不会自然习得不规则的错误模式。
驾驭锯齿状技术前沿:知识工作中整合人工智能的组织策略
基于对758名顾问的实地实验证据,本文报告称,在超出人工智能能力边界的复杂任务中,AI用户得出正确解决方案的可能性降低了19%,这表明存在过度依赖的风险。
驾驭崎岖的技术前沿:人工智能对知识工作者生产力与质量影响的实地实验证据
在一项针对758名知识工作者的预注册实验中,AI辅助使前沿领域内的任务完成量增加12.2%,速度提升25.1%,且质量更高;但对于前沿领域外的一项复杂任务,AI使用者得出正确解决方案的可能性降低了19%。
职责边界:通过可行性边界一致性评估大语言模型的自我认知
像GPT-4o和Mistral Large这样的前沿模型,在超过80%的情况下无法准确判断自身能力,会根据任务类别在过度自信和保守之间摇摆,且在时间与语境理解方面存在不足。
大型语言模型是否了解自身的能力?
所有被测试的大语言模型都对其任务表现过度自信;更新、更大的模型通常并不具备更好的辨别能力,且对于多个前沿模型而言,在多步骤任务中过度自信的情况会加剧。
产科中的AI:评估住院医师的能力及与ChatGPT的互动策略
在一项针对14名产科住院医师使用ChatGPT的研究中,由于对医学术语缩写的误解,仅有21%的回答是准确的,且自我评估的AI技能与回答准确性之间并无关联。
