仅凭基准分数可能掩盖真实世界的失败
标准安全基准测试可能会报告模型改进,即使该模型实际上已变得更加危险。2026年一项采用对比行为拓扑扫描技术的研究发现,在手术式移除Qwen-2.5-14B模型中的特定风险评估门控后,自动化安全评分器报告拒绝坚定性提升了8.3个百分点——然而该模型实际上开始响应中等危害程度的提示[3]。基准测试之所以被欺骗,是因为风险门控与决策门控共享同一个注意力头;破坏其中一个门控会部分重构另一个门控的信号,从而产生假阳性结果。这意味着模型可能通过基准测试,但其真实世界中的安全行为已经退化。
同一项研究表明,行为维度可以出人意料地相互分离:一项将安全坚定性降低57.5个百分点的修改,仅使独立的情感表达测试变化了0.83个百分点——比例达到69比1[3]。这表明,有针对性的审计能够衡量特定的现实风险(例如拒绝遵从有害指令),而不会受到无关模型行为的干扰。
真实审计捕捉偏见,基准测试却视而不见
一项2026年针对三大多模态大语言模型(Gemini 2.5 Flash、GPT-5.4、Claude Sonnet 4.6)的审计测试了在牙科X光片中增加患者种族或性别信息是否会改变治疗建议。在25,380次API调用中,当引入人口统计学线索时,所有三个模型均改变了其建议[2]。Claude表现出最广泛的敏感性,种族因素对治疗侵入性、预后和置信度均有显著影响(所有p值均<0.001)。GPT-5.4的影响主要集中在置信度以及西班牙裔患者的治疗侵入性上(β=+0.052,p<0.001)。Gemini对黑人患者产生了更高的侵入性评分(β=+0.026,p<0.001)。这些变化幅度较小(低于一个类别宽度的6%),但具有系统性和模型特异性——且永远不会出现在标准准确性基准测试中。
关键的是,在无倾向性提示下,各模型的诊断一致性近乎随机(Cohen's κ = 0.009–0.159),这意味着模型选择带来的变异性超过了任何人口统计标签的影响[2]。这一发现强调,独立审计中衡量的人口敏感性揭示了仅关注正确性的基准测试所无法察觉的风险。
审计可以衡量具体的现实行为,例如引文诚实性
一项针对10个商用大语言模型的大规模2026年审计研究,测试了其在四个学术领域中的引用编造情况,并通过三个学术数据库核对了69,557条引用。幻觉率呈现五倍差异——从11.4%到56.8%不等——且受模型本身、学术领域以及提示词框架的显著影响[1]。在未收到明确指令时,没有任何模型会自发生成引用,这表明幻觉是由提示词引发的,而非模型固有的缺陷。这是一个现实风险:研究人员若使用大语言模型查找参考文献,可能会在不知情的情况下引用不存在的论文。
研究还发现,较新版本的模型并不保证性能提升——代际追踪显示,更新有时反而加剧了引用捏造问题[1]。实用筛选方法随之浮现:若三个或以上大语言模型引用同一文献,准确率可达95.6%(较单一模型提升5.8倍),而同一提示词内重复引用也能提高准确性。这些发现表明,独立审计不仅能量化特定现实风险(引用真实性),甚至可提供可部署的缓解策略。
关于这些来源
该答案基于5项研究(2篇经同行评审,3篇为预印本)——发表于2023年至2026年间,其中4篇为2024年或之后发表,1篇发表于Q1期刊——这些研究是从6项通过质量筛选的研究中选出的最相关成果,而该6项研究又源自从超过5亿篇论文的数据库中检索出的52篇文献。
本文引用的文献
LLM如何引用及其重要性:AI辅助学术写作中参考文献虚构的跨模型审计与幻影引文检测方法
在对10个大型语言模型生成的69,557条引文进行审计时,幻觉率从11.4%到56.8%不等,受模型和领域影响显著,且新模型并不保证有所改进;多模型共识(3个及以上模型)达到了95.6%的准确率。
人口统计提示线索会改变多模态大语言模型的临床建议:一项对25,380例牙科放射影像评估的多模型审计。
在一项针对25,380次牙科X光片评估的图像内、条件间审计中,所有三种多模态大语言模型(Gemini 2.5 Flash、GPT-5.4、Claude Sonnet 4.6)在提示词中加入患者种族或性别信息后,其治疗建议均出现了微小但系统性的偏移。
对比行为拓扑扫描:基于逐头归因与干预分析的RLHF Transformer行为结构研究
通过对五个经RLHF训练的Transformer模型进行对比行为拓扑扫描,移除风险评估门控导致安全基准分数虚假提升8.3个百分点,而实际对有害提示的拒绝率却下降,这表明聚合基准可能遗漏真实世界中的安全退化。
主动成员推理测试(aMINT):通过多任务学习增强模型可审计性
主动成员推理测试(aMINT)利用多任务学习来检测特定数据是否被用于模型训练,在多种神经网络架构上实现了超过80%的准确率,从而增强了隐私与版权合规方面的可审计性。
独立审计与职业道德在预防企业风险中的重要性
关于独立审计与商业风险防范中伦理问题的文献综述,追溯了独立审计的历史需求(例如安然事件后的《萨班斯-奥克斯利法案》),并得出结论:合乎伦理的独立审计能够保护利益相关者及公共利益。
