前沿AI评估衡量的究竟是现实危害,还是仅仅测试分数?
当前大多数前沿AI系统的评估,都是通过标准化基准测试来检验特定能力——比如回答问题、生成文本或解数学题。这些基准测试有助于比较模型性能,但无法反映模型在混乱、不可预测的现实世界中可能造成的危害。2024年一篇关于内部审计功能的论文指出,危险能力可能意外出现,并在标准测试中未被察觉,这意味着一个通过所有基准测试的模型,在部署后仍可能造成严重危害[2]。这是一个根本性的局限:基准测试衡量的是我们想测试的内容,而非模型在被滥用或与复杂系统交互时可能实际做出的行为。
另一篇关于前沿人工智能开发负责任报告的论文指出,开发者对其系统拥有大量安全关键信息,但这些信息很少与监管机构或公众共享[3]。缺乏这种透明度,外部评估只能评估开发者选择披露的内容,导致现实世界中的风险——例如模型被用于生成虚假信息或自动化网络攻击——在很大程度上难以察觉。该论文呼吁强制报告安全关键信息,以填补这一空白[3]。
一篇2023年关于深度伪造与虚假信息的论文指出,生成式AI能够制造出难以被识别的逼真虚假内容,而随着模型不断改进,当前用于检测此类内容的基准很快就会过时[4]。这意味着,今天在深度伪造检测基准测试中表现良好的模型,明天仍可能被用来制造无法识别的虚假信息。该论文主张建立持续、自适应的防御机制,而非依赖一次性的基准评估[4]。
为何即使现实危害大幅增加,现有评估也可能毫无察觉
一项2026年关于网络犯罪损失的研究揭示了一个严峻问题:现实世界危害的基础数据噪声过大,以至于即使人工智能显著加剧了损失,也无法被察觉。该研究估计全球网络犯罪年损失约为5000亿美元,但90%置信区间却横跨1000亿至1万亿美元[1]。这意味着不确定性极大——真实数值可能比估算值高十倍或低十倍。研究人员计算得出,若人工智能导致损失增加约20%,将带来1000亿美元甚至更多的额外损失,但他们最终得出结论:"网络犯罪数据仍过于残缺,无法直接检测到此类增量增长"[1]。换言之,即便前沿人工智能系统引发了网络犯罪的激增,当前的评估方法也无法对其进行衡量。
这一发现直接回答了问题:前沿人工智能评估无法衡量现实世界风险,因为检测变化所需的现实世界数据过于不精确。论文建议采用受害者调查——直接询问人们的损失情况——而非依赖执法报告或宏观经济模型,但即便是这些调查也存在较大的误差范围[1]。因此,尽管基准测试能告诉我们模型在特定任务上是否变得“更好”,却无法说明这种改进是否会转化为现实世界中更多的危害。
要让评估衡量真实世界风险,需要什么?
多篇论文共同指出,缩小基准测试与现实世界风险之间的差距,需要的不仅是更完善的测试,更是更强有力的治理。一篇2023年关于前沿人工智能监管的论文提出了三大支柱:制定安全标准的流程、要求注册与报告以使监管机构掌握开发动态,以及确保安全标准得到执行的合规机制[5]。该论文特别建议实施部署前的风险评估、对模型行为进行外部审查,以及部署后的持续监测[5]。这些措施均超越了基准评估的范畴,旨在衡量模型在实际环境中可能表现出的真实行为。
该内部审计报告补充指出,前沿人工智能开发者需要设立独立的内部审计职能,以评估其风险管理实践的有效性[2]。这并非测试模型本身,而是检验围绕模型的相关流程——企业是否真正在排查现实风险、是否建立了管控措施、董事会是否准确了解当前的风险水平[2]。报告指出,内部审计能够识别无效的风险管理实践,并可作为举报人的联络渠道,但也警告称,审计工作可能被高级管理层操控,其成效取决于相关人员识别无效实践的能力[2]。
综合来看,这些论文表明,现实世界的风险测量不仅仅是一个关于更好基准的技术问题——它更是一个治理问题。如果没有强制性报告、独立监督和持续监测,即使是最先进的评估,也只能衡量我们已知需要测试的内容,而无法捕捉前沿人工智能可能造成危害的不可预测方式。
关于这些来源
该答案基于5项研究(4篇经同行评审,1篇预印本)——发表于2023年至2026年间,其中3篇为2024年及以后发表,1篇发表于Q1期刊,合计被引159次——这些研究从5项通过质量筛选的研究中选出,作为最相关的内容,而后者又源自从超过5亿篇论文的数据库中检索到的49篇文献。
本文引用的文献
全球网络犯罪损失:前沿人工智能风险评估的基准
全球网络犯罪造成的损失估计约为每年5000亿美元(90%置信区间:1000亿至1万亿美元),且研究发现,即使人工智能驱动导致损失增加20%,现有数据也无法检测到这一变化。这表明,现实世界中的危害基线过于模糊,以至于当前的评估无法衡量增量风险。
前沿人工智能开发者需要设立内部审计职能。
认为前沿人工智能的危险能力可能以不可预测且未被察觉的方式出现,而当前的风险治理存在不足;提出应设立内部审计职能,用于评估风险管理实践,而不仅仅是模型基准测试。
前沿人工智能开发的负责任报道
建议前沿人工智能开发者向政府和公民社会强制报告安全关键信息,因为当前的评估无法洞察只有开发者才能看到的现实世界风险。
深度伪造、虚假信息与误导信息在前沿人工智能、生成式人工智能及大型AI模型时代的表现
探讨了生成式AI如何制造难以识别的深度伪造和虚假信息,并指出当前的检测基准很快会过时,因此需要持续性的自适应防御,而非一次性评估。
前沿人工智能监管:管理新兴公共安全风险
提出监管框架的三大支柱——标准制定、注册/报告制度以及合规执行——以管理前沿人工智能风险,强调在基准测试之外,还需进行部署前的风险评估和部署后的持续监测。
