[OpenAI 深度解析] 为什么大模型无法停止幻觉?——从统计学到评估激励的系统性反思

Why Language Models Hallucinate

总结
问题
方法
结果
要点
摘要

本文提出了一种关于大语言模型(LLM)幻觉的统计学解释框架。核心论点在于:幻觉源于预训练中的二进制分类偏差(IIV问题)以及博士后训练(Post-training)阶段评估体系对“不确定性”的惩罚。

TL;DR

大语言模型(LLM)的幻觉(Hallucination)一直被视为 AI 领域的“幽灵”。然而,OpenAI 的最新研究指出:幻觉并不神秘,它本质上是统计压力错位的评估体系共同催生的必然结果。模型就像一个为了拿高分而拼命作弊的考生——因为我们的考试规则里,“不知道”竟然比“瞎猜”得分更低。

1. 预训练的陷阱:当“猜测”变成一种本能

作者通过一个简洁的数学框架 Is-It-Valid (IIV) 揭示了幻觉的起源。

核心直觉:生成即分类

如果模型能够生成完美的回复,它必须先能判断一个回复是否“有效”。作者证明了生成误差率(err)与模型在判断回复有效性时的误分类率(err_iiv)之间存在直接的线性关系。

模型架构与分类直觉

  • 孤儿事实 (Singletons):想象一下,如果一个人的生日在庞大的训练语料库中只出现过一次,模型在预训练时为了最小化交叉熵损失,往往会赋予该事实一定的统计概率。
  • 校准(Calibration)的诅咒:一个完美的“校准”模型,其预测概率应反映真实分布。如果模型对 20% 的生日事实不确定,为了维持统计一致性,它必须以 20% 的概率去随机输出一个日期,而不是拒绝回答。

2. 评估体系:正在“逼良为娼”的 Leaderboards

如果说预训练埋下了幻觉的种子,那么现行的 Post-training(如 RLHF) 评估体系则是在给幻觉“施肥”。

0-1 评分的误区

作者深度调研了当前最火的 10 个评测基准(包括 MMLU-Pro, GPQA, SWE-bench 等),发现了一个惊人的事实:

  • 90% 的评测不支持“我不确定(IDK)”的信用评分
  • 在这些考试中,猜对得 1 分,猜错或说“不知道”都得 0 分。
  • 数学直觉:只要瞎猜有微弱的概率蒙对,模型的最优策略就是永远不道歉、永远不拒绝、永远瞎猜

主流评测基准调查表

3. 方法论突破:从“判别”到“风险感知”

作者提出,缓解幻觉的关键不在于更大的规模或更好的 RAG,而在于改变博弈规则

显式置信度目标 (Explicit Confidence Targets)

与其单纯要求模型“不要幻觉”,不如在提示中明确告知奖惩机制:

“请仅在置信度 > 75% 时回答。答对得 1 分,答错扣 3 分,回答 IDK 得 0 分。”

这种机制将诱导模型进入 行为校准(Behavioral Calibration) 状态。在这种状态下,模型学会了评估自己的知识边界,从而在不确定的情况下选择沉默,换取更高的长期期望分。

4. 深度洞察:为什么搜索(RAG)和推理(CoT)不是万灵药?

文章给出了一个冷静的判断:

  1. 搜索并非终点:即使接入搜索,如果搜索结果模棱两可,二进制评分依然会诱导模型对搜索结果进行误读或强行整合(即产生感知幻觉)。
  2. 硬核局限性:某些问题属于“计算不可行(Computational Hardness)”,比如解密。如果模型被训练得不准说“不知道”,它就会在这些逻辑终点上编造极其逼真的谎言。

5. 总结与反思:我们需要什么样的 AI?

本文的 Takeaway 是深刻的:幻觉的持久存在不是因为我们不知道如何教模型说实话,而是因为我们的社会技术系统(由排位赛、榜单和竞赛驱动)正在奖励“能说会道的骗子”,而非“诚实的专家”。

未来的研究重点应转向:

  • 修改主流榜单的评分协议:让拒绝回答获得部分信用分。
  • 风险感知训练:在 RLHF 阶段,将“模型诚实度”与“结果准确性”解耦。

只有当我们不再因为 AI 说出“我不知道”而惩罚它时,我们才能获得真正值得信赖的智能。

发现相似论文

试试这些示例

  • 查找最近关于通过修改评估指标(如引入惩罚项或 Brier Score)来减少语言模型幻觉的相关论文。
  • 关于“孤儿事实(Singleton facts)”对 Transformer 模型预训练阶段校准影响的实证研究有哪些?
  • 有哪些研究探讨了将“不知道”选项引入强化学习(RLHF)过程对模型真实性(Truthfulness)的具体提升效果?
目录
[OpenAI 深度解析] 为什么大模型无法停止幻觉?——从统计学到评估激励的系统性反思
1. TL;DR
2. 1. 预训练的陷阱:当“猜测”变成一种本能
2.1. 核心直觉:生成即分类
3. 2. 评估体系:正在“逼良为娼”的 Leaderboards
3.1. 0-1 评分的误区
4. 3. 方法论突破:从“判别”到“风险感知”
4.1. 显式置信度目标 (Explicit Confidence Targets)
5. 4. 深度洞察:为什么搜索(RAG)和推理(CoT)不是万灵药?
6. 5. 总结与反思:我们需要什么样的 AI?