当模型提供商披露更少数据时,AI安全基准测试是否有效?

当模型提供商披露的数据减少时,AI安全基准的可靠性会因博弈风险、文化盲区以及评估指标中隐藏的偏见而下降。

直接答案

当模型提供商披露的数据减少时,人工智能安全基准的可靠性会随之下降,但问题并非简单的“是”或“否”所能概括。综合所审查的研究来看,核心问题在于:当训练数据被隐藏时,基准测试可能被操纵或过时[3];同时,由于评估指标本身存在的文化偏见和隐含假设,这些基准往往无法准确衡量其声称要评估的内容[1][2][4]。例如,一项对210个安全基准的审查发现,许多基准未能遵循基本的风险管理原则,即便在完全公开数据的情况下也缺乏有效性[1]。另一项研究表明,用于开放式生成基准测试的偏见分类器本身可能对某些人口群体存在偏见,无论模型提供商披露多少信息,都会导致结果偏差[4]。因此,尽管数据披露减少会使情况恶化,但基准测试本身存在的深层缺陷即使在完全透明的情况下依然无法消除。

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

当提供者隐藏数据时,基准测试更容易被操纵——但它们本就存在漏洞

对模型训练数据了解得越少,就越难判断基准测试分数究竟反映的是真实安全性,还是仅仅是巧妙的过拟合。一项涵盖约110项基准测试实践研究的重大跨学科综述发现,数据污染——即模型在训练过程中已接触过基准测试的示例——是一个普遍问题,削弱了分数的可信度[3]。当模型提供方披露的数据越少,你就越无法核查这种污染,这使得提供方很容易宣称高分,但这些分数却无法转化为实际应用中的安全性。同一篇综述还指出,开发者常常为了优化测试成绩而非实际安全性而操纵基准测试,当评估过程不透明时,这一问题会进一步恶化[3]

然而,即便实现完全的数据透明,基准测试仍存在深层次的结构性缺陷。一项针对210项安全基准的独立审查发现,许多测试未能将其测量指标与现实风险挂钩,原因在于它们忽视了既有的风险管理原则,也未明确界定哪些可测、哪些不可测[1]。这意味着,即便你完全了解训练数据,基准测试本身也可能在衡量错误的对象。这两项审查共同表明,信息披露不足会放大已有的缺陷,但并非问题的根源。

基准测试忽视区域与文化安全问题——数据越少,漏洞越难察觉

安全基准并非放之四海而皆准;它们往往反映西方的文化假设,而当模型提供方披露的数据较少时,你无法判断该模型是否已针对特定区域的危害进行了调整。一项为巴基斯坦创建的文化适配偏见基准(PakBBQ)研究发现,多语言大语言模型在获得明确的消歧提示后,平均准确率提升了12%,且模型在乌尔都语中表现出的反偏见行为比英语中更为显著[2]。这意味着,为一种文化设计的基准可能会遗漏另一种文化中的严重安全问题,而如果不了解模型训练所用的数据,就无法评估这些漏洞是否已被弥补。

同一研究还发现,仅通过改变提问方式——即采用负面或正面措辞提问——就能减少刻板印象的回答,这表明基准测试结果对提示语的措辞高度敏感[2]。当模型提供商披露的数据越少,你就越难以判断模型在安全基准测试中的表现是否在不同文化背景下依然稳健,抑或仅仅是测试措辞的偶然结果。这正是那项涵盖210个基准测试的综述所揭示的普遍问题的一个具体例证:基准测试往往未能将其目标与现实世界相连接,而数据披露越少,这种脱节就越难被发现[1]

就连评估安全性的工具也可能存在偏见——而数据越少,这种偏见就越隐蔽

安全基准测试通常依赖自动分类器来评估模型输出,但这些分类器本身可能存在偏差,从而扭曲结果。一项针对开放式生成偏差基准(如BOLD和SAGED)的研究发现,用于分析大语言模型输出的分类器对不同人口统计描述词的处理并不平等,导致对哪些模型存在偏差得出不公正的结论[4]。研究人员采用反事实测试——改变提示词中与刻板印象相关的前缀——发现分类器的预测在不同人口群体间存在显著差异,这意味着基准测试衡量的不仅是模型的偏差,同样也反映了分类器自身的偏差[4]

当模型提供商披露的数据越少,你就越无法审查评估工具中隐藏的偏见是否在夸大或压低安全评分。该研究明确呼吁建立更稳健的偏见度量模型,但如果提供商不分享评估流程的细节,问题便无从显现[4]。这与那项涵盖110项研究的综述结论一致:基准测试往往难以区分信号与噪声,而文档不充分则是一个系统性缺陷[3]。数据披露越少,意味着文档越少,进而导致噪声增多,任何安全声明的可信度也随之降低。

关于这些来源

该回答基于4项研究(1篇经同行评审,3篇为预印本)——发表于2024年至2026年,其中4篇为2024年或之后发表——这些研究是从通过质量筛选的4项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的32篇文献。

本文引用的文献

1

AI安全基准应如何衡量安全性?

一项对210项安全基准的审查发现,许多基准未能遵循既定的风险管理原则,也未明确哪些可以测量、哪些不能测量,即便完全公开数据,其有效性也受到削弱。

2

PakBBQ:面向问答的文化适应性偏见基准

针对巴基斯坦文化适配的偏见基准测试(PakBBQ)显示,大语言模型在乌尔都语中的消歧准确率比英语高出12%,且表现出更强的反偏见行为,这表明现有基准测试忽略了区域安全问题,且对提示措辞高度敏感。

3

我们能信任AI基准测试吗?——AI评估当前问题的跨学科审视

一项涵盖约110项研究的跨学科元分析指出,基准测试存在系统性缺陷,包括数据污染、结果操纵以及文档记录不足,而模型提供者披露的数据越少,这些问题就越严重。

4

评估用于大语言模型开放式生成偏差基准的度量模型中的偏差

一项关于开放式生成偏见基准的研究发现,用于评估大语言模型输出的分类器本身对人口统计描述词的处理存在不平等,无论模型提供方披露多少信息,结果都会出现偏差。