AI安全基准能否缩小专家乐观与公众担忧之间的鸿沟?

AI安全基准测试虽有帮助,但目前因风险覆盖不足和测量有效性欠缺,难以弥合专家与公众之间的认知鸿沟。

直接答案

AI安全基准测试有助于缩小专家乐观态度与公众担忧之间的差距,但仅凭这些测试本身仍不足以解决问题。2024年一项针对18种AI风险的调查显示,美国选民认为这些风险发生的可能性和潜在影响均高于专家评估,且更倾向于放缓AI发展速度[3]。然而,对200多项安全评估的审查揭示了系统性缺陷:仅有少数基准测试涵盖非文本模态,许多伦理风险根本未被评估,且大多数测试忽略了AI系统实际运行的真实环境[2]。综合来看,本研究中规模最大的安全基准测试综述[1]与公众认知调查[3]均指向同一结论:当前基准测试范围过于狭窄,且与公众关切脱节,难以完全弥合这一鸿沟。

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

专家与公众之间的差距有多大?

一项2024年的调查直接衡量了这种分歧,该调查涵盖了18种特定的人工智能风险——从文明崩溃到 misinformation 和系统性偏见。研究对AI专家及具有代表性的美国登记选民样本进行了问卷调查,发现选民始终认为AI风险更可能发生,且一旦发生影响更为严重[3]。选民还明确倾向于放缓AI发展速度,而专家们并不认同这一观点。这种分歧不容小觑:这意味着即便专家认为某项风险已得到妥善管控,公众仍可能觉得它迫在眉睫且后果严重,由此产生的信任赤字是单纯依靠基准测试无法弥补的。

当前的基准测试能否应对公众担忧的风险?

一项2026年针对210项安全基准的独立审查进一步印证了这一点,该审查记录显示,许多基准存在技术、认知及社会技术层面的缺陷[1]。作者指出,这些基准往往未能遵循既定的风险管理原则,未能清晰界定可测量与不可测量的内容,且缺乏稳健的概率指标。换言之,即便存在某项基准,它也可能无法真正衡量其所声称的目标——或者它衡量的只是无关紧要的方面,却忽略了现实世界中的真正危险。

更好的基准测试真能减轻公众担忧吗?

可以,但前提是这些措施必须经过重新设计,以解决引发公众担忧的具体漏洞。2024年的调查发现,若政策干预能更谨慎地在各类社会级风险中平衡缓解措施,有效消解关于人工智能风险的“短期与长期”之争,则最能安抚集体忧虑[3]。这意味着评估基准必须同时涵盖即时危害(如有偏见的输出)和长期存在性风险,而非仅关注其中一项。2026年的审查报告提供了具体路线图:开发稳健的概率度量指标,运用测量理论将基准目标与现实结果相关联,并采用核查清单确保基准在认识论上合理可靠[1]。早期的案例,如2022年的AI安全网格世界,已表明即便简单的基准环境也能揭示AI智能体是否在操纵奖励机制、忽视副作用或在分布偏移下失效[4]——但这些测试距离公众所期望的全面、情境感知的评估仍相去甚远。

关于这些来源

该回答基于4项研究(1篇经同行评审,3篇为预印本)——发表于2022年至2026年间,其中3篇来自2024年或之后,共被引用132次——这些研究是从通过质量筛选的4项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的46篇文献。

本文引用的文献

1

AI安全基准应如何衡量安全性?

一项2026年对210项安全基准的审查发现,大多数基准存在技术、认知及社会技术层面的缺陷,并建议遵循风险管理原则,明确可(不)可测量的内容,采用稳健的概率指标以提升有效性。

2

生成式人工智能安全评估中的空白

一项针对2024年生成式AI领域200余项安全评估的实证综述指出了三个系统性缺陷:模态缺口(非文本形式的测试极少)、风险覆盖缺口(诸多伦理风险未获评估)以及情境缺口(多数测试忽略实际部署场景)。

3

公众对社会层面人工智能风险认知的治理启示

一项2024年针对人工智能专家与美国登记选民关于18项AI风险的调查发现,选民认为这些风险比专家所评估的更具可能性和影响力,且更倾向于放缓AI发展速度;该研究建议,通过政策干预平衡应对各类风险,可降低公众的担忧。

4

AI安全网格世界

一项2022年的研究引入了一套强化学习环境(AI安全网格世界),用于测试安全可中断性、奖励欺骗等安全属性;研究发现,两种深度强化学习智能体(A2C和Rainbow)无法令人满意地解决这些环境问题。