[OpenAI 深度解析] 为什么大模型无法停止幻觉?——从统计学到评估激励的系统性反思
Why Language Models Hallucinate
本文提出了一种关于大语言模型(LLM)幻觉的统计学解释框架。核心论点在于:幻觉源于预训练中的二进制分类偏差(IIV问题)以及博士后训练(Post-training)阶段评估体系对“不确定性”的惩罚。
TL;DR
大语言模型(LLM)的幻觉(Hallucination)一直被视为 AI 领域的“幽灵”。然而,OpenAI 的最新研究指出:幻觉并不神秘,它本质上是统计压力与错位的评估体系共同催生的必然结果。模型就像一个为了拿高分而拼命作弊的考生——因为我们的考试规则里,“不知道”竟然比“瞎猜”得分更低。
1. 预训练的陷阱:当“猜测”变成一种本能
作者通过一个简洁的数学框架 Is-It-Valid (IIV) 揭示了幻觉的起源。
核心直觉:生成即分类
如果模型能够生成完美的回复,它必须先能判断一个回复是否“有效”。作者证明了生成误差率(err)与模型在判断回复有效性时的误分类率(err_iiv)之间存在直接的线性关系。

- 孤儿事实 (Singletons):想象一下,如果一个人的生日在庞大的训练语料库中只出现过一次,模型在预训练时为了最小化交叉熵损失,往往会赋予该事实一定的统计概率。
- 校准(Calibration)的诅咒:一个完美的“校准”模型,其预测概率应反映真实分布。如果模型对 20% 的生日事实不确定,为了维持统计一致性,它必须以 20% 的概率去随机输出一个日期,而不是拒绝回答。
2. 评估体系:正在“逼良为娼”的 Leaderboards
如果说预训练埋下了幻觉的种子,那么现行的 Post-training(如 RLHF) 评估体系则是在给幻觉“施肥”。
0-1 评分的误区
作者深度调研了当前最火的 10 个评测基准(包括 MMLU-Pro, GPQA, SWE-bench 等),发现了一个惊人的事实:
- 90% 的评测不支持“我不确定(IDK)”的信用评分。
- 在这些考试中,猜对得 1 分,猜错或说“不知道”都得 0 分。
- 数学直觉:只要瞎猜有微弱的概率蒙对,模型的最优策略就是永远不道歉、永远不拒绝、永远瞎猜。

3. 方法论突破:从“判别”到“风险感知”
作者提出,缓解幻觉的关键不在于更大的规模或更好的 RAG,而在于改变博弈规则。
显式置信度目标 (Explicit Confidence Targets)
与其单纯要求模型“不要幻觉”,不如在提示中明确告知奖惩机制:
“请仅在置信度 > 75% 时回答。答对得 1 分,答错扣 3 分,回答 IDK 得 0 分。”
这种机制将诱导模型进入 行为校准(Behavioral Calibration) 状态。在这种状态下,模型学会了评估自己的知识边界,从而在不确定的情况下选择沉默,换取更高的长期期望分。
4. 深度洞察:为什么搜索(RAG)和推理(CoT)不是万灵药?
文章给出了一个冷静的判断:
- 搜索并非终点:即使接入搜索,如果搜索结果模棱两可,二进制评分依然会诱导模型对搜索结果进行误读或强行整合(即产生感知幻觉)。
- 硬核局限性:某些问题属于“计算不可行(Computational Hardness)”,比如解密。如果模型被训练得不准说“不知道”,它就会在这些逻辑终点上编造极其逼真的谎言。
5. 总结与反思:我们需要什么样的 AI?
本文的 Takeaway 是深刻的:幻觉的持久存在不是因为我们不知道如何教模型说实话,而是因为我们的社会技术系统(由排位赛、榜单和竞赛驱动)正在奖励“能说会道的骗子”,而非“诚实的专家”。
未来的研究重点应转向:
- 修改主流榜单的评分协议:让拒绝回答获得部分信用分。
- 风险感知训练:在 RLHF 阶段,将“模型诚实度”与“结果准确性”解耦。
只有当我们不再因为 AI 说出“我不知道”而惩罚它时,我们才能获得真正值得信赖的智能。
