数据披露越少,审计难度越大——证据说明了什么
当模型提供商减少数据共享时,审计人员便无法直接基于真实用户信息测试模型的偏差、准确性或安全性。2024年一项关于人工智能审计实践的归类研究发现,仅有部分审计能转化为理想的问责结果,而数据访问受限是主要障碍之一[2]。该研究根据审计主体——包括监管机构、律所、民间团体、记者、学者及咨询公司——进行分类,并指出那些对模型内部数据访问权限较少的审计方(如记者或民间团体),往往难以取得有效的问责成果[2]。这意味着,若缺乏充足数据,即便是出于善意的审计也可能无法发现问题或推动整改。
实际影响在于,审计人员只能依赖可获取的资源:公共API、有限的测试集或合成数据。这限制了分析的深度。例如,若公平性审计无法获取原始训练数据中的受保护属性(如种族或性别),就可能遗漏系统性偏差。2024年的论文[2]强调,审计设计及制度环境——包括数据访问权限——对审计有效性至关重要。
合成数据能否填补空白?2025年框架展现希望
一种可行的替代方案是使用合成数据,这类数据在模仿原始数据集的同时不会泄露敏感信息。2025年的一项研究提出了一种框架,能够生成满足差分隐私的合成数据——即对数据进行适度修改以保护隐私,同时保留其统计模式[1]。在针对三个真实数据集(Adult、COMPAS和Diabetes)的实验中,研究人员将合成数据与真实数据的公平性指标进行了对比。他们发现,合成数据能够足够准确地保留公平性特征,从而支持有意义的评估,尽管具体数值会因数据集和指标的不同而有所差异[1]。例如,在COMPAS再犯率数据集中,合成数据与真实数据在公平性指标上的差异足够小,仍能有效检测出偏差模式。
这意味着,即使数据提供方拒绝共享原始数据,审计员仍可请求获取一份经过差分隐私处理的合成数据版本,并据此开展有效的公平性审计。其代价是精确度略有损失——合成数据虽不完美,但远胜于完全无数据可用。2025年的论文[1]表明,这种方法在严格审计与强隐私保护之间取得了平衡,使其适用于刑事司法或医疗等敏感领域。
三层审计法:多层级审核弥补数据局限
针对大型语言模型(LLMs)这类常被视为黑箱且信息披露有限的系统,2023年的一篇论文提出了三层审计策略:对提供方的治理审计、训练后发布前的模型审计,以及最终产品的应用审计[3]。这种分层方法意味着,即便提供方对模型内部细节披露甚少,审计人员仍可核查提供方的政策(治理层)并测试应用的行为(应用层)。而数据需求最高的模型层,则可通过其他两层加以补充。
2023年的论文[3]明确指出,由于大语言模型涌现出的能力及其广泛的下游应用,对其进行审计颇具挑战性,但该论文主张,通过在所有三个层面开展结构化、协调一致的审计,可以识别并管理伦理与社会风险。然而,论文也提醒道,仅靠审计无法解决所有治理问题——它是一种工具,而非万能药。这表明,在数据披露有限的情况下,多层级审计策略仍能发现问题,但审计方必须对所能达成的效果保持现实态度。
关于这些来源
该答案基于3项研究(2篇经同行评审,1篇为预印本)——发表于2023年至2025年间,其中2篇为2024年及以后发表,共被引用206次——这些研究是从通过质量筛选的3项研究中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索出的33篇文献。
本文引用的文献
使用差分隐私合成数据对人工智能公平性进行定量审计
一项2025年的研究框架利用差分隐私合成数据,在三个真实数据集(Adult、COMPAS、Diabetes)上表明,合成数据的公平性指标与真实数据高度一致,从而在保护隐私的同时实现了有意义的审计。
AI审计:AI问责之路上的故障巴士
2024年人工智能审计实践分类研究发现,仅有部分审计能带来问责结果,数据访问受限是关键因素;审计设计与制度环境对有效性至关重要。
审计大型语言模型:一种三层方法
一篇2023年的论文提出了一种针对大型语言模型的三层审计方法(治理层、模型层、应用层),以弥补数据局限性,但同时也指出仅靠审计无法解决所有治理挑战。
