什么是灾难性漂移,为什么它会威胁持续学习?
当你持续用新数据训练大型语言模型时,它可能会“忘记”之前学到的内容——这就是灾难性遗忘或漂移。之所以会发生这种情况,是因为为了适应新任务而更新模型权重,会覆盖掉编码旧知识的模式[1]。在2025年的一项综述中,研究人员将这一现象描述为持续学习的主要障碍,并指出它既出现在纵向(从通用到特定)适应中,也出现在横向(跨时间/领域)适应中[1]。
这个问题并非大语言模型独有——它影响任何神经网络,甚至量子网络也不例外。2022年的一项研究发现,量子机器学习模型在分类任务中同样存在遗忘现象,这表明该问题具有根本性[5]。关键要点在于:漂移不是一个小缺陷,而是任何持续学习系统都必须应对的核心挑战。
基于排练的方法能否在不存储所有旧数据的情况下扩展?
是的,一种很有前景的方法是自我合成式复演:模型自行生成过去任务的合成示例来进行复演,从而无需存储原始数据。在2024年的一项研究中,这种方法在效果上达到或超越了使用真实旧数据的传统复演方式,同时更具数据效率[3]。它还保留了模型的通用领域能力,这对实际部署至关重要[3]。
这之所以重要,是因为在实际操作中,你往往无法访问原始训练数据——只能拿到一个检查点。自我合成式复述通过让模型自身生成训练样本来解决这一问题,使得即使在数据稀缺或涉及隐私的情况下,持续学习也能切实可行[3]。
正则化方法是否优于朴素重训练?
是的,数据很明确。在一项为期两年、对100栋建筑进行的大规模对比中,弹性权重巩固(EWC)相比静态模型平均将预测误差降低了约14%,而梯度情景记忆(GEM)则将其降低了约8%[2]。这些方法还节省了计算时间和数据存储成本,使其在长期适应中更具实用性[2]。
同一项研究发现,持续学习方法在长期保持准确性方面比传统模型更新更有效,而传统模型更新常常面临概念漂移和遗忘问题[2]。因此,尽管简单重新训练看似更直接,但从长远来看,它实际上可靠性更低。
持续学习在什么情况下仍会失败?
即便采用了良好的方法,漂移也无法完全消除。2025年的调查强调,当前的方法在知识迁移和遗忘问题上仍面临挑战,尤其是在任务差异很大的情况下[1]。作者呼吁开发更好的基准测试和专门针对抗遗忘设计的方法[1]。
此外,其效果也会因领域而异。建筑能耗研究表明,虽然EWC和GEM确实有所帮助,但改善程度并非在所有建筑中都一致——有些建筑受益更多,有些则较少[2]。因此,你需要监测性能,并根据具体应用调整策略。
关于这些来源
这个回答基于5篇同行评审研究——发表于2022年至2025年间,其中3篇为2024年或之后发表,3篇发表于Q1期刊,合计被引用70次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的44篇文献。
本文引用的文献
大语言模型的持续学习:综合综述
2025年一项关于大语言模型持续学习的调查指出,灾难性遗忘是关键挑战,并概述了纵向(从通用到特定)和横向(跨时间/领域)的持续学习,呼吁建立更好的基准和方法来应对遗忘。
大规模比较与示范持续学习在自适应数据驱动建筑能耗预测中的应用
在一项基于100栋建筑两年数据的大规模对比中,弹性权重巩固和梯度情景记忆等持续学习方法相较于静态模型,平均将预测误差分别降低了约14%和约8%,同时减少了计算时间和存储成本。
使用自合成复述缓解大型语言模型中的灾难性遗忘
2024年的一项研究提出了“自合成复述”方法,即让大语言模型生成合成训练实例用于复述训练;该方法在数据效率更高且保持通用领域能力的同时,取得了优于或媲美传统复述方法的性能。
生成式人工智能的持续学习:从大语言模型到多模态大语言模型及未来展望
一篇关于生成式AI持续学习的2025年综述(涵盖从大语言模型到多模态大语言模型)指出,灾难性遗忘主要表现为模型输出的漂移,并讨论了应对该问题的方法。
量子持续学习:克服灾难性遗忘
2022年的一项研究表明,量子机器学习模型在分类任务中同样存在灾难性遗忘问题,并提出了基于损失函数景观中局部几何信息的策略来克服这一挑战。
