专家与公众之间的差距有多大?
一项2024年的调查直接衡量了这种分歧,该调查涵盖了18种特定的人工智能风险——从文明崩溃到 misinformation 和系统性偏见。研究对AI专家及具有代表性的美国登记选民样本进行了问卷调查,发现选民始终认为AI风险更可能发生,且一旦发生影响更为严重[3]。选民还明确倾向于放缓AI发展速度,而专家们并不认同这一观点。这种分歧不容小觑:这意味着即便专家认为某项风险已得到妥善管控,公众仍可能觉得它迫在眉睫且后果严重,由此产生的信任赤字是单纯依靠基准测试无法弥补的。
当前的基准测试能否应对公众担忧的风险?
一项2026年针对210项安全基准的独立审查进一步印证了这一点,该审查记录显示,许多基准存在技术、认知及社会技术层面的缺陷[1]。作者指出,这些基准往往未能遵循既定的风险管理原则,未能清晰界定可测量与不可测量的内容,且缺乏稳健的概率指标。换言之,即便存在某项基准,它也可能无法真正衡量其所声称的目标——或者它衡量的只是无关紧要的方面,却忽略了现实世界中的真正危险。
更好的基准测试真能减轻公众担忧吗?
可以,但前提是这些措施必须经过重新设计,以解决引发公众担忧的具体漏洞。2024年的调查发现,若政策干预能更谨慎地在各类社会级风险中平衡缓解措施,有效消解关于人工智能风险的“短期与长期”之争,则最能安抚集体忧虑[3]。这意味着评估基准必须同时涵盖即时危害(如有偏见的输出)和长期存在性风险,而非仅关注其中一项。2026年的审查报告提供了具体路线图:开发稳健的概率度量指标,运用测量理论将基准目标与现实结果相关联,并采用核查清单确保基准在认识论上合理可靠[1]。早期的案例,如2022年的AI安全网格世界,已表明即便简单的基准环境也能揭示AI智能体是否在操纵奖励机制、忽视副作用或在分布偏移下失效[4]——但这些测试距离公众所期望的全面、情境感知的评估仍相去甚远。
关于这些来源
该回答基于4项研究(1篇经同行评审,3篇为预印本)——发表于2022年至2026年间,其中3篇来自2024年或之后,共被引用132次——这些研究是从通过质量筛选的4项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的46篇文献。
本文引用的文献
AI安全基准应如何衡量安全性?
一项2026年对210项安全基准的审查发现,大多数基准存在技术、认知及社会技术层面的缺陷,并建议遵循风险管理原则,明确可(不)可测量的内容,采用稳健的概率指标以提升有效性。
生成式人工智能安全评估中的空白
一项针对2024年生成式AI领域200余项安全评估的实证综述指出了三个系统性缺陷:模态缺口(非文本形式的测试极少)、风险覆盖缺口(诸多伦理风险未获评估)以及情境缺口(多数测试忽略实际部署场景)。
公众对社会层面人工智能风险认知的治理启示
一项2024年针对人工智能专家与美国登记选民关于18项AI风险的调查发现,选民认为这些风险比专家所评估的更具可能性和影响力,且更倾向于放缓AI发展速度;该研究建议,通过政策干预平衡应对各类风险,可降低公众的担忧。
AI安全网格世界
一项2022年的研究引入了一套强化学习环境(AI安全网格世界),用于测试安全可中断性、奖励欺骗等安全属性;研究发现,两种深度强化学习智能体(A2C和Rainbow)无法令人满意地解决这些环境问题。
