模型坍塌究竟是什么?
模型崩溃是一种退化过程,指像大型语言模型这样的生成式AI,在训练数据中包含其他AI模型生成的内容后,逐渐丧失生成多样且高质量输出的能力。这就像复印件的复印件:每一代都会丢失细节并引入错误,直到最终版本变成模糊无用的废纸。发表在《自然》杂志上的里程碑式研究[1]将其定义为“不可逆的缺陷”,即“原始内容分布的尾部消失”——这意味着模型会遗忘罕见但重要的信息,比如小众词汇或冷门事实。
同一项研究[1]在多种模型类型中验证了这一效应,包括大语言模型(LLMs)、变分自编码器(VAEs)和高斯混合模型(GMMs),表明这是生成式AI普遍存在的问题。他们构建了一个理论框架来解释这一现象的原因,并警告称,随着互联网上AI生成内容日益泛滥,来自真实人类互动的数据价值将变得越来越珍贵。
多少合成数据才算危险?哪怕只有一点点。
你可能会认为,只要训练数据大部分由人类撰写,少量AI生成的文本无伤大雅。但证据表明并非如此。2024年的一项研究[5]发现,即便训练集中仅有1%的合成数据,也可能导致“严重模型崩溃”——即训练数据规模不断扩大却不再提升模型性能的关键性能退化。这一发现令人震惊,因为它颠覆了“数据越多越好”的常规缩放定律假设。
同一项研究[5]还探讨了增大模型规模——如当前GPT-4等模型的趋势——究竟是有益还是有害。在简化条件下,他们发现更大的模型实际上会加剧模型崩溃,使问题变得更糟。然而,他们也指出,一旦超过某个“插值阈值”(对于非常大的数据集而言,该阈值可能极高),更大的模型或许能略微缓解崩溃,但无法完全避免。这表明,单纯扩大规模并非解决之道。
模型能否避免崩溃?可以,但需要谨慎的策略。
好消息是,研究人员正在开发避免模型崩溃的方法。2025年的一项研究[3]提出了一种简单而有效的策略:在训练过程中谨慎控制合成数据与人类生成数据的比例。他们通过数学证明,只要维持适当的平衡,就能确保模型达到稳定且高质量的均衡状态,而非逐渐退化。
另一种有前景的策略是采用验证机制——在将AI生成的数据用于训练之前,先通过独立系统(或人工)检查其质量。2024年的一项研究[4]利用高斯混合模型和线性分类器对该方法进行了理论刻画,并在两项实际任务中进行了测试:使用Transformer计算矩阵特征值,以及利用大语言模型进行新闻摘要。研究发现,即使是不完美的验证器也能防止模型崩溃,并开发出一个可量化的代理指标来预测验证何时有效。这一点至关重要,因为检查输出是否优质往往比从零生成优质输出更容易。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2024年至2025年间,其中5篇为2024年或之后发表,1篇发表于Q1期刊,累计被引用429次——这些研究是从7篇通过质量筛选的研究中选出的最相关成果,而7篇研究又源自从超过5亿篇论文数据库中检索到的32篇文献。
本文引用的文献
AI模型在递归生成的数据上进行训练时会发生崩溃。
这篇《自然》论文是关于模型崩溃的基础性研究,表明当大型语言模型、变分自编码器和高斯混合模型在递归生成的数据上进行训练时,会导致不可逆的缺陷,原始分布的尾部会消失。
面向生命周期的大语言模型新兴威胁与脆弱性综述
这份2025年的调查报告将模型崩溃视为大语言模型生命周期中的新兴威胁,将其与另外16种漏洞并列归类,并呼吁对其成因及缓解措施开展更多研究。
防止在使用合成数据训练大语言模型时出现模型崩溃
这篇2025年的论文提出了一种简单策略,通过控制合成数据与人类生成数据的比例来防止模型崩溃,并从数学上证明在适当条件下存在稳定均衡。
超越模型崩溃:使用合成数据扩展规模需要验证
这篇2024年ICLR论文表明,在合成数据上使用验证器可以防止模型崩溃,即使验证器并不完美,并且该论文还提供了一个理论框架,以及在Transformer和大语言模型上的实验验证。
强模型崩溃
这篇2024年ICLR论文提出了“强模型崩溃”的概念,表明仅1%的合成数据就可能导致模型崩溃,且更大的模型会加剧这一问题,尽管在超过高插值阈值后,它们可能略微缓解该现象。
