到底是什么让用户真正信任一个AI系统?
对人工智能的信任不仅仅关乎技术准确性,更在于系统被感知的能力、正直性和善意。2021年一项对多家公司专家进行的访谈研究发现,知识获取、透明度、可解释性、认证以及自我设定的标准,是提升对AI整体信任的关键因素[1]。就世界模型恢复而言,这意味着用户需要看到系统如何运作、为何做出某些决策,以及它是否经过独立验证——而不仅仅是它在测试中表现良好。
为何认证恢复系统——而非整个模型——才是关键
2024年一项关于强化学习系统的研究提出了一条切实可行的路径:只需对故障恢复系统进行认证,而无需对整个AI模型进行认证[2]。这是一个颠覆性的改变,因为世界模型复杂且难以完全验证,但一个能够检测模型何时处于分布外(OOD)状态并安全介入的恢复系统,则可以更简单、更易于测试。通过将认证重点集中在这个安全关键组件上,用户就能获得清晰、可审计的保证,确保系统能够安全失效——而这正是建立信任的关键所在。
关键在于:过度信任可能制造危险的错觉
一项2026年关于基于世界模型的具身AI调查警告称,世界模型可以作为安全护盾,但当其受到损害或被过度信任时,会产生“预测性安全幻觉”[3]。这意味着,如果用户过于盲目地信任恢复系统,他们可能会忽视模型正在失效的迹象。该调查概述了安全故障的评估协议以及鲁棒接地和不确定性感知预测等防御措施,强调信任必须通过严格测试持续赢得——而非一次认定后便不再关注。
关于这些来源
这个回答基于3项研究(2项经同行评审,1项为预印本)——发表于2021年至2026年间,其中2项为2024年或之后发表,1项发表于Q1期刊,合计被引用278次——这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的48篇文献。
本文引用的文献
我们能信任AI吗?一项关于信任要求的实证研究及成功采用AI的指南
2021年一项对多家公司专家的访谈研究指出,透明度、可解释性、认证以及自我设定的标准是提升对人工智能信任的关键因素,并强调了其与传统技术的根本差异。
你能信任你的智能体吗?分布外检测对强化学习系统安全性的影响
2024年一项关于强化学习系统的研究指出,在安全关键应用中,只需对故障恢复系统进行认证,而无需对整个模型进行认证,这为建立信任提供了一条切实可行的路径。
基于世界模型的具身人工智能安全性:威胁、防御与评估的全生命周期
一项2026年关于基于世界模型的具身AI的调查,追踪了模型全生命周期中的威胁,并警告称过度信任世界模型可能产生“预测性安全错觉”,进而提出了评估协议及鲁棒接地与不确定性感知预测等防御措施。
