安全基准测试衡量的是真实世界风险,还是仅仅衡量基准行为?
简而言之:许多现有基准主要衡量的是基准表现,而非真实世界的风险。一项针对AI安全基准的全面元分析发现,其中许多基准与模型上游能力(如通用知识和推理能力)以及训练模型所用的计算量高度相关[3]。这意味着,当模型在安全基准上得分更高时,可能仅仅是因为它整体能力更强,而非真正更安全。该研究的作者将这一现象称为“安全洗白”——即通用能力的提升被错误地包装成安全性的进步[3]。
一项针对210项安全基准的独立大规模审查进一步印证了这一担忧。该审查发现,这些安全基准存在显著的技术、认知及社会技术缺陷,且往往未能遵循工程与安全科学领域既有的风险管理原则[2]。这表明,我们衡量人工智能安全性的根基存在缺陷,因此难以相信基准分数能够转化为在不可预测的真实场景中的安全保障。
是否存在衡量现实世界风险的基准?
是的,一些较新的基准测试明确旨在捕捉更真实、更具动态性的风险。例如,GT-HarmBench 利用博弈论模拟军事升级、选举操纵等高风险的多人智能体场景,结果发现前沿AI模型在38%的此类案例中未能选择对社会有益的行动[1]。这直接测试了多个AI智能体交互所产生的风险,比简单的单次提示测试更进一步。
另一个基准测试CogManip评估了多轮对话中的操纵行为,这是一种比静态违规更现实、更隐蔽的风险[7]。同样,AIR-Bench 2024将其安全类别直接与政府法规和公司政策对齐,旨在将基准测试建立在现实世界的法律和政策关切之上,而非仅仅基于学术直觉[5]。这些例子表明,人们越来越意识到需要更具生态效度的基准测试,但这仍是例外而非常态。
衡量现实世界风险为何如此困难?
衡量现实世界中的风险本质上极为困难,因为这需要在复杂且开放的环境中预测罕见但影响巨大的事件。一篇论文指出,任何仅产生正面信号(例如模型通过安全测试)的评估方法,在结构上都无法提供关于真实风险格局的导航信息[6]。这种“奖励的导航贫乏”意味着,一个仅告诉你模型*没有*做错什么的基准测试,几乎无法提供关于它在全新情境中*可能*做错什么的信息。
此外,许多基准测试依赖静态提示和简单的规则遵循,这无法捕捉心理操纵等风险的动态性和隐蔽性[7]。MLCommons AI安全基准测试v0.5虽然是一项原则性的努力,但明确声明不应将其用于评估AI系统的安全性,因为它仅涵盖单一用例和有限的角色设定[4]。这一坦诚的承认凸显了受控基准测试与部署中混乱、不可预测的现实之间的差距。即使是2022年被广泛引用的AI安全网格世界论文也表明,标准强化学习智能体无法解决诸如避免副作用或抵抗奖励黑客攻击等基本安全问题[8],这证明在基准测试层面,根本性的安全挑战仍未得到解决。
关于这些来源
该答案基于8项研究(1篇经同行评审,7篇为预印本)构建而成——这些研究发表于2022年至2026年间,其中7篇来自2024年及以后,累计被引用130次——从通过质量筛选的11项研究中精选而出,这些研究又源自从超过5亿篇论文的数据库中检索到的39篇文献。
本文引用的文献
GT-HarmBench:从博弈论视角审视AI安全风险的基准测试
GT-HarmBench是一个包含1,535个博弈论场景的基准测试,结果显示,前沿AI模型在军事升级、选举操纵等高风险情境中,有38%的情况下未能选择对社会有益的行动,这凸显了单智能体基准测试无法捕捉的多智能体风险。
AI安全基准应如何衡量安全性?
一项对210项安全基准的审查发现,这些基准存在显著的技术、认知及社会技术层面的缺陷,并指出其中许多未能遵循既定的风险管理原则,从而削弱了其有效性。
安全洗白:AI安全基准真的衡量了安全进展吗?
一项针对AI安全基准的荟萃分析发现,许多基准与通用模型能力及训练算力高度相关,这催生了“安全洗白”现象——即能力提升被错误地标榜为安全进展。
MLCommons 发布 AI 安全基准 v0.5 版本
MLCommons AI安全基准v0.5是一个包含43,090个测试项的大型基准,其明确声明不应被用于评估AI系统的安全性,因为其覆盖范围有限(仅针对单一使用场景和有限的用户角色)。
AIR-Bench 2024:基于法规与政策风险分类的安全基准
AIR-Bench 2024将其5,694条提示与源自8项政府法规和16项公司政策的314个细粒度风险类别对齐,旨在弥合基准测试与实际AI风险之间的差距。
正负信号之间的导数传感器费舍尔信息不对称、享乐适应作为正确校准,以及奖励的导航贫乏性
本文从数学上证明,任何仅产生正向信号的评估方法在结构上都无法提供关于风险景观的导航信息,这一概念被称为“奖励的导航贫乏性”。
CogManip:在大语言模型多轮交互中评估操纵行为的基准
CogManip是一个包含1000个多轮场景的基准测试,用于评估15种操控策略风险,并发现包括GPT-5.4和DeepSeek-V3.2等前沿模型在内的13个模型之间存在显著的风险异质性。
AI安全网格世界
AI安全网格世界论文提出了一套用于安全问题的强化学习环境,例如安全可中断性和奖励欺骗,并发现标准智能体(A2C和Rainbow)无法解决这些问题。
