[NIPS 2018] 证据深度学习:让神经网络在“不知道”时勇敢说不

Evidential Deep Learning to Quantify Classification Uncertainty

2022-01-01
Murat Sensoy, Melih Kandemir, Lance Kaplan
总结
问题
方法
结果
要点
摘要

本文提出了一种名为证据深度学习(Evidential Deep Learning, EDL)的方法,用于量化分类任务中的不确定性。该方法通过将神经网络的输出视为狄利克雷分布(Dirichlet Distribution)的参数,从而将单一的概率预测扩展为对概率分布本身的建模(二阶概率),在 MNIST 和 CIFAR-10 数据集上取得了领先的样本外(OOD)检测及对抗攻击鲁棒性。

TL;DR

传统的神经网络像是一个自大的考生,即便面对从未学过的题目也会瞎猜一个高分。本文提出的 Evidential Deep Learning (EDL) 通过主观逻辑(Subjective Logic)将神经网络改造为一个能够量化自身知识边界的“诚实学者”。它通过一层简单的非负激活(如 ReLU)输出证据量,构建 Dirichlet 分布,从而实现在不增加模型复杂度、无需多次采样的情况下,精准识别出离群数据和对抗攻击。

背景:Softmax 的盲目与 BNN 的沉重

在目前的分类任务中,Softmax 是绝对的统治者。但 Softmax 存在一个致命缺陷:它只给出相对置信度

  • 例子:如果你给一个识别数字的 AI 看一张猫的照片,Softmax 可能会在“数字 8”上给出 0.9 的概率,仅仅是因为这张猫的照片在特征空间里稍微像 8 一点。
  • 代价:这种“过度自信”在自动驾驶等安全领域是不可接受的。

为了解决这个问题,学术界此前多采用贝叶斯神经网络 (BNN)。BNN 虽然有效,但需要对权重进行随机采样(如 Monte Carlo Dropout),这会导致推理速度变慢,且不确定性估计的质量高度依赖采样次数。

核心直觉:从“概率预测”到“证据收集”

作者引入了主观逻辑 (Subjective Logic)。其核心思想是:不确定性 和各类的信仰质量(Belief Masses) 之间存在守恒关系: 这里的关键在于,当我们没有证据支持任何一类时, 趋近于 1(全知之无);当证据 增加时, 降低。

架构革新

EDL 的做法非常优雅且极简:

  1. 去掉 Softmax:改用 ReLU 激活层,确保输出是非负的。这个输出被定义为“证据”
  2. 构建 Dirichlet 分布:每个类别的参数
  3. 计算不确定性:总强度 ,则不确定性

模型架构与推理直觉 在旋转数字 1 的实验中(上图),可以看到当角度增加到模型不再能识别时,Softmax(左)依然给出高概率,而 EDL(右)的不确定性曲线(阴影部分)迅速上升,诚实地表达了“我不确定”。

方法论:如何训练一个“证据”网络?

由于我们预测的是一个分布而非点估计,传统的交叉熵损失不再完全适用。作者提出了三种损失函数,最终选择了基于 Bayes Risk on L2 Loss 的形式: 这个公式包含两个迷人的性质:

  • 误差项 (Error Term):惩罚预测均值与真值的偏差。
  • 方差项 (Variance Term):促使模型在训练集上增加证据,从而减小预测方差。

为了防止非目标类别的证据乱涨,作者还增加了一个 KL 散度正则化项,强制将误导性证据压低到 0,使模型在拿不准时表现得更像均匀分布。

实验战绩:OOD 与对抗攻击的克星

1. 样本外(Out-of-Distribution)检测

当模型在 MNIST(数字)上训练,但在 notMNIST(字母)上测试时,理想的模型应该给出极高的熵。 OOD 实验结果 上图 CDF 曲线右下角表示更高质量的不确定性估计。可以看到,EDL(红色曲线)完美超越了包括 Dropout 和 Deep Ensemble 在内的所有强基线。

2. 对抗攻击下的表现

在 FGSM 对抗扰动下,随着干扰强度 增加,所有模型的精度都会下降。但 EDL 的牛逼之处在于:当它猜错时,它通常知道自己在瞎猜。它的预测熵随干扰强度线性上升,而其他模型往往会陷入“自信地答错”的窘境。

对抗实验

深度洞察:为什么这很重要?

EDL 的核心贡献在于它实现了 Aleatoric(数据本身噪声)Epistemic(模型知识缺失) 不确定性的潜在区分。

  • 通过将参数层级提升到二阶(Dirichlet 分布),模型有了一个额外的自由度来表达“我不知道”。
  • 计算效率:这是该工作被广泛引用的主要原因。它是一次前向传播的确定性网络,没有任何训练或推理时的随机采样开销,非常适合落地。

局限性与未来

虽然在 MNIST 和 CIFAR-5 上表现惊艳,但在更复杂的、类别极多的数据集上,Dirichlet 分布的参数可能会面临数值稳定性挑战。此外,如何将这种证据理论应用到更复杂的结构(如 Transformer)或生成式任务(如 LLM 的幻觉检测)将是未来非常有前景的方向。


总结:EDL 告诉我们,神经网络不应该仅仅是分类器,更应该是证据收集器。给预测结果贴上一个“我不确定”的标签,有时比给出一个高分的错误答案更具智慧。

发现相似论文

试试这些示例

  • 查找最近其他尝试改进 Evidential Deep Learning (EDL) 在大规模数据集(如 ImageNet)上缩放能力的研究。
  • 哪篇论文最早在不确定性估计中讨论了认知不确定性 (Epistemic Uncertainty) 与偶然不确定性 (Aleatoric Uncertainty) 的区分,本文是如何在 Subjective Logic 框架下统一它们的?
  • 有哪些研究将基于 Dirichlet 分布的证据学习方法应用到了回归任务或物体检测等非分类任务中?
目录
[NIPS 2018] 证据深度学习:让神经网络在“不知道”时勇敢说不
1. TL;DR
2. 背景:Softmax 的盲目与 BNN 的沉重
3. 核心直觉:从“概率预测”到“证据收集”
3.1. 架构革新
4. 方法论:如何训练一个“证据”网络?
5. 实验战绩:OOD 与对抗攻击的克星
5.1. 1. 样本外(Out-of-Distribution)检测
5.2. 2. 对抗攻击下的表现
6. 深度洞察:为什么这很重要?
7. 局限性与未来