[NIPS 2018] 证据深度学习:让神经网络在“不知道”时勇敢说不
Evidential Deep Learning to Quantify Classification Uncertainty
本文提出了一种名为证据深度学习(Evidential Deep Learning, EDL)的方法,用于量化分类任务中的不确定性。该方法通过将神经网络的输出视为狄利克雷分布(Dirichlet Distribution)的参数,从而将单一的概率预测扩展为对概率分布本身的建模(二阶概率),在 MNIST 和 CIFAR-10 数据集上取得了领先的样本外(OOD)检测及对抗攻击鲁棒性。
TL;DR
传统的神经网络像是一个自大的考生,即便面对从未学过的题目也会瞎猜一个高分。本文提出的 Evidential Deep Learning (EDL) 通过主观逻辑(Subjective Logic)将神经网络改造为一个能够量化自身知识边界的“诚实学者”。它通过一层简单的非负激活(如 ReLU)输出证据量,构建 Dirichlet 分布,从而实现在不增加模型复杂度、无需多次采样的情况下,精准识别出离群数据和对抗攻击。
背景:Softmax 的盲目与 BNN 的沉重
在目前的分类任务中,Softmax 是绝对的统治者。但 Softmax 存在一个致命缺陷:它只给出相对置信度。
- 例子:如果你给一个识别数字的 AI 看一张猫的照片,Softmax 可能会在“数字 8”上给出 0.9 的概率,仅仅是因为这张猫的照片在特征空间里稍微像 8 一点。
- 代价:这种“过度自信”在自动驾驶等安全领域是不可接受的。
为了解决这个问题,学术界此前多采用贝叶斯神经网络 (BNN)。BNN 虽然有效,但需要对权重进行随机采样(如 Monte Carlo Dropout),这会导致推理速度变慢,且不确定性估计的质量高度依赖采样次数。
核心直觉:从“概率预测”到“证据收集”
作者引入了主观逻辑 (Subjective Logic)。其核心思想是:不确定性 和各类的信仰质量(Belief Masses) 之间存在守恒关系: 这里的关键在于,当我们没有证据支持任何一类时, 趋近于 1(全知之无);当证据 增加时, 降低。
架构革新
EDL 的做法非常优雅且极简:
- 去掉 Softmax:改用 ReLU 激活层,确保输出是非负的。这个输出被定义为“证据” 。
- 构建 Dirichlet 分布:每个类别的参数 。
- 计算不确定性:总强度 ,则不确定性 。
在旋转数字 1 的实验中(上图),可以看到当角度增加到模型不再能识别时,Softmax(左)依然给出高概率,而 EDL(右)的不确定性曲线(阴影部分)迅速上升,诚实地表达了“我不确定”。
方法论:如何训练一个“证据”网络?
由于我们预测的是一个分布而非点估计,传统的交叉熵损失不再完全适用。作者提出了三种损失函数,最终选择了基于 Bayes Risk on L2 Loss 的形式: 这个公式包含两个迷人的性质:
- 误差项 (Error Term):惩罚预测均值与真值的偏差。
- 方差项 (Variance Term):促使模型在训练集上增加证据,从而减小预测方差。
为了防止非目标类别的证据乱涨,作者还增加了一个 KL 散度正则化项,强制将误导性证据压低到 0,使模型在拿不准时表现得更像均匀分布。
实验战绩:OOD 与对抗攻击的克星
1. 样本外(Out-of-Distribution)检测
当模型在 MNIST(数字)上训练,但在 notMNIST(字母)上测试时,理想的模型应该给出极高的熵。
上图 CDF 曲线右下角表示更高质量的不确定性估计。可以看到,EDL(红色曲线)完美超越了包括 Dropout 和 Deep Ensemble 在内的所有强基线。
2. 对抗攻击下的表现
在 FGSM 对抗扰动下,随着干扰强度 增加,所有模型的精度都会下降。但 EDL 的牛逼之处在于:当它猜错时,它通常知道自己在瞎猜。它的预测熵随干扰强度线性上升,而其他模型往往会陷入“自信地答错”的窘境。

深度洞察:为什么这很重要?
EDL 的核心贡献在于它实现了 Aleatoric(数据本身噪声) 和 Epistemic(模型知识缺失) 不确定性的潜在区分。
- 通过将参数层级提升到二阶(Dirichlet 分布),模型有了一个额外的自由度来表达“我不知道”。
- 计算效率:这是该工作被广泛引用的主要原因。它是一次前向传播的确定性网络,没有任何训练或推理时的随机采样开销,非常适合落地。
局限性与未来
虽然在 MNIST 和 CIFAR-5 上表现惊艳,但在更复杂的、类别极多的数据集上,Dirichlet 分布的参数可能会面临数值稳定性挑战。此外,如何将这种证据理论应用到更复杂的结构(如 Transformer)或生成式任务(如 LLM 的幻觉检测)将是未来非常有前景的方向。
总结:EDL 告诉我们,神经网络不应该仅仅是分类器,更应该是证据收集器。给预测结果贴上一个“我不确定”的标签,有时比给出一个高分的错误答案更具智慧。
