攻击者能否简单地逆转“遗忘”?
是的,而且这出奇地容易。2024年的一项研究表明,仅凭一小部分关联松散的数据集,攻击者就能“唤醒”一个已“遗忘”模型的记忆,让那些本应被删除的信息重新浮现[2]。例如,在公开的医学文章上重新学习,会让一个已遗忘的模型输出有害的生物武器知识;而重新学习关于哈利·波特的维基百科通用信息,则迫使模型逐字输出记忆中的文本[2]。这意味着,当前许多近似“遗忘”的方法往往只是压制输出,而非真正抹除知识,因此你应当假设,一个能访问公开数据的坚定攻击者可以逆转这一效果。
攻击者如何让模型对其他人也失效?
攻击者可以构造一个看似合法实则损害模型对良性用户效用的遗忘请求。2025年的一项研究提出了一种“隐蔽攻击”,利用基于微调的机器遗忘中存在的两个弱点:无法限制遗忘效果的范围,以及无法区分良性词元与遗忘信号[1]。通过在遗忘数据中微妙地增加常见良性词元的出现频率,攻击者强化了这些词元与遗忘信号之间的关联,从而当普通用户在提示中包含此类词元时,模型会表现出遗忘行为——如幻觉或假装无知——导致意外的效用下降[1]。该研究还提出了一种“范围感知遗忘”方法,在遗忘目标中加入范围项以限定遗忘效果,显著提升了对这种攻击的鲁棒性[1]。
为什么流行事实更难被遗忘,这对攻击者意味着什么?
流行事实在预训练阶段会被更深度地记忆,且比冷门事实更难被移除,然而许多遗忘方法对所有训练数据频率施加统一的梯度压力[3]。一项2026年的研究提出了一种自适应方法(AdaPop),该方法根据事实的流行度调整遗忘压力,并使用外部代理(如Wikidata站点链接或LLM-as-Judge)来衡量流行度[3]。与竞争方法相比,该方法在释义查询下泄露的遗忘内容减少了5倍,在对抗性改写下减少了1.6倍[3]。这表明攻击者可以利用流行度偏差:他们可以通过释义或对抗性改写来查询模型,从而提取被遗忘的内容,尤其是针对流行事实,除非遗忘方法明确考虑流行度因素。
针对这些滥用场景,你能做哪些准备?
你需要将“遗忘”视为一个风险管理问题,而不是一次性的删除操作。2025年提出的一个框架(FROC)提供了一种为遗忘行为设定风险预算的方法,使你能够比较不同的遗忘策略,并选择能在遗忘充分性与效用保留之间取得平衡的超参数[4]。该框架计算“共形遗忘风险”——即被遗忘样本仍对预测产生影响的概率估计——并识别出符合你风险预算的配置[4]。此外,2025年的一项研究表明,你可以通过完全不将遗忘目标纳入遗忘目标函数来避免强化对敏感数据的暴露;他们的方法(部分模型崩溃)有意触发分布崩溃以移除信息,并认为这种方法更符合隐私约束[5]。最后,2025年的一项知识系统化梳理指出,经典的机器学习攻击——如成员推断、后门攻击、对抗攻击和反演攻击——同样适用于遗忘场景,因此你也应考虑这些威胁[6]。
关于这些来源
这个回答基于6项研究(1篇同行评审,5篇预印本)——发表于2024年至2026年间,其中6项来自2024年或之后——从6项通过质量筛选的研究中选出最具相关性的内容,这些研究源自从超过5亿篇论文数据库中检索到的22篇文献。
本文引用的文献
关注大模型遗忘:隐藏风险与应对之策
提出了一种隐蔽攻击,通过操纵遗忘请求来降低模型对良性用户的效用,并提出了范围感知的机器遗忘方法(Scope-aware Unlearning)以缓解该问题。
遗忘还是混淆?通过良性再学习唤醒已遗忘大语言模型的记忆
表明,在小型、关联松散的数据集上进行良性重新学习,可以逆转“遗忘”效果,例如,在医学文章上重新学习恢复了生物武器知识,而维基百科信息则恢复了逐字逐句的《哈利·波特》文本。
越受欢迎,越难遗忘:面向大语言模型遗忘的自适应流行度方法
提出AdaPop,一种基于自适应流行度的遗忘方法,在改写查询下泄露的已遗忘内容比基线少5倍,在对抗性重构下少1.6倍。
FROC:一种面向大语言模型机器遗忘的统一风险优化控制框架
提出FROC,一个风险控制框架,利用共形分析来估计被遗忘样本影响预测的概率,并在风险预算内选择遗忘超参数。
模型崩溃并非缺陷,而是大语言模型机器遗忘中的一种特性
提出部分模型坍缩(PMC),一种在目标函数中不使用遗忘目标的去学习(unlearning)方法,利用分布坍缩来移除信息,同时保持实用性。
遗忘有多安全?将机器遗忘与机器学习攻击联系起来
系统化梳理了经典机器学习攻击(后门攻击、成员推断、对抗攻击、逆向攻击)与机器遗忘之间的知识关联,并指出了当前面临的安全挑战。
