为什么“被遗忘”的信息在“遗忘”后还能重新出现?
遗忘方法往往并不能真正抹除知识——它们只是将其压制,而现有的评估手段无法察觉这一点。在一项研究中,对经过遗忘处理的模型应用量化(一种通过降低模型精度来压缩的技术)后,原本“被遗忘”的信息得以恢复:在完整精度下,本应被遗忘的知识平均保留率为21%,而在4位量化后跃升至83%[2]。这意味着,如果模型以较低精度格式部署(这在追求效率时很常见),那些被认为已删除的数据可能会重新浮现,而标准基准测试无法检测到这一点,因为它们只测试完整精度下的模型。
同一项研究发现,对于带有效用约束的遗忘方法,即使在完全精度下,模型平均仍保留了21%的被遗忘知识——因此遗忘从一开始就从未彻底完成[2]。这表明,仅检查少量测试查询的评估很容易遗漏模型权重中隐藏的残余知识。
基准测试如何被误导,在“遗忘”失败时却显示出成功?
基准测试容易受到简单修改的影响,从而暴露出其缺陷。一篇2025年的立场论文发现,即使在遗忘信息和保留信息之间引入松散的依赖关系,也能证明原本被认为已遗忘的信息仍然可访问,或者遗忘过程对模型在保留信息上的性能造成的损害远超原始基准所显示的程度[4]。这意味着现实世界的数据往往存在主题重叠,而将遗忘集和保留集视为相互独立的基准测试可能会带来虚假的成功感。
另一项研究表明,当前的评估指标容易受到红队攻击的影响——它们反映的是模型的表层行为,而非其真正保留的知识程度[3]。例如,模型可能会给出看似遗忘的通用拒绝回应,但底层知识其实仍然存在。作者提出了更稳健的指标和一种校准方法,以恢复非目标数据上的性能,但关键要点在于,标准指标是可以被操纵的。
当前的大模型“遗忘”基准测试是否对进展过于乐观?
是的,现有基准测试对“遗忘”效果的评价过于乐观,可能产生误导。2025年的立场文件通过向主流基准测试引入良性修改证明了这一点,结果暴露出被遗忘的信息仍然可访问,或者保留知识的退化程度比报告中的更严重[4]。这表明,许多已发表的“遗忘”研究成果可能无法反映真实世界中的表现。
同一篇论文还警告称,遗忘目标中的模糊性可能导致方法过度拟合给定的测试查询,这意味着它们在基准测试上表现良好,但在略有不同的查询上却会失效[4]。这是一个关键缺口,因为现实世界中的遗忘请求很少像基准测试集那样清晰明确。
关于这些来源
本回答基于5项同行评审研究——发表于2024年至2025年,其中5项为2024年或之后发表,1项发表于Q1期刊,合计被引用130次——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文数据库中检索到的25篇文献。
本文引用的文献
重新思考大型语言模型的机器遗忘
本综述聚焦大语言模型遗忘研究中常被忽视的方面,包括遗忘范围、数据与模型的交互作用,以及多维度效能评估,并呼吁建立更全面的评估框架。
通过量化导致的大语言模型遗忘灾难性失败
本研究发现,对已“遗忘”模型进行量化处理能够恢复被“遗忘”的信息:在4位量化后,本应被遗忘知识的平均保留率从全精度下的21%上升至83%,这表明现有基准测试无法检测出隐藏的知识。
迈向大语言模型遗忘方法的有效评估与比较
本文表明,当前的评估指标容易受到红队攻击的影响,可能反映的是模型的表面行为而非真正的知识保留,并提出了更稳健的指标及一种校准方法以改进评估。
立场:大语言模型去学习基准是衡量进展的薄弱指标
本立场文件表明,现有基准测试对“遗忘”效果的评价过于乐观,因为简单的修改即可揭示出,未学习的信息仍然可被访问,或保留的知识受损程度比报告中的更为严重,并警示人们不要过度拟合测试查询。
数据擦除的前沿:面向大型语言模型的机器遗忘综述
本综述回顾了针对大型语言模型的机器遗忘方法,聚焦于为应对隐私、伦理及法律挑战而进行的定向遗忘,但并未就评估失败提供具体的量化研究结果。
