大型语言模型中的稀疏奖励子系统:从黑盒探针到价值与多巴胺神经元
Sparse Reward Subsystem in Large Language Models
本文研究大型语言模型隐藏状态中的奖励信息结构,提出由价值神经元与多巴胺神经元组成的稀疏奖励子系统。论文通过简单探针和输入维度剪枝证明,不到百分之一的神经元即可预测状态价值与步级时序差分误差,并展示了模型信心预测与过程奖励模型两类应用。
TL;DR
这篇论文要解决的核心问题不是“隐藏状态里能不能解码奖励”,而是“奖励信息到底怎样分布在神经元中”。作者把自回归模型生成的中间状态看成强化学习状态,训练两层MLP价值探针和多巴胺探针,再用输入权重L1范数剪枝定位极少数关键神经元。Table 2 的干预实验显示,零化约百分之一的价值神经元会使 Qwen-2.5-7B-SimpleRL-Zoo 在 MATH500 上的平均准确率从75.2降到20.3;Table 3 显示价值神经元在信心预测中平均AUC为0.67;Table 4 显示多巴胺探针作为过程奖励模型时可把MATH500验证子集准确率提升到77.8。整体看,这篇工作更接近机制可解释性中的实证发现型论文,它把“奖励可解码”进一步落实为“奖励信号由稀疏且因果相关的神经元子系统承载”。
背景定位
在大型语言模型的奖励相关研究中,已有工作通常使用全维度 hidden state probe 来预测答案正确性、模型置信度、幻觉或事实性。本文的推进点在于:它不是再训练一个更强的探针,而是追问奖励信息的神经元级组织方式。论文将两类神经元命名为 value neurons 和 dopamine neurons,并明确说明这些名称来自神经科学类比,而不是声称模型内部存在多巴胺生化机制。这个命名策略有风险,也容易产生传播力;因此真正重要的不是名字,而是论文是否给出了定位、因果和迁移三组证据。
问题与动机
现有方法的具体空白在于结构不可解释:如果一个全维度探针能预测奖励,它可能依赖分散在数千维中的冗余相关,也可能依赖少量高度特异性的神经元。两种情况下工程含义完全不同。前者只说明信号可读出;后者才意味着模型内部存在可用于轻量干预、信心预测或搜索引导的功能模块。论文因此需要回答三个问题:奖励相关信号是否低维可压缩;它是否集中在少数神经元;这些神经元是否真正参与推理而非仅仅被探针挑中。
论文给出的直觉来自两条线。第一条是 maximum-entropy RL:高质量策略与价值函数紧密耦合,因此策略模型内部可能天然编码价值信息。第二条是 superposition hypothesis:高频且高重要性的特征更可能获得稀疏专门表示。这两条理由都不是严格证明,但它们为“价值与TD误差这类低维标量信号可能被少数神经元承载”提供了可检验的机制假设。
核心章节:稀疏奖励子系统的三段论证
出发点:奖励信息为何可能稀疏且低维
论文首先把模型生成过程形式化为部分推理轨迹上的决策。初始状态是问题输入,每一步生成一个 token 并更新状态,直到终止状态。终止奖励是二值正确性信号。模型对当前状态的价值被定义为:
其中 是已经生成到第 步的状态, 是最终正确性奖励,期望下标 表示未来 rollout 由冻结模型自身采样。这个式子在论文中的作用是定义价值探针的预测目标,使 hidden state 探针不再只是“能否答对”的后验分类,而是对应强化学习中的状态价值。若把未来生成策略换成外部策略,该价值仍是新策略分布下的期望;但论文关注固定模型 ,因此价值变化主要来自内部表征与生成过程,而不是策略更新。若终端奖励不是二值正确性而是长程折扣奖励,这个定义就需要显式引入折扣求和,论文主体使用的是未折扣的终端正确性。
为什么这种信号可能稀疏?论文给出信息论动机:对于二值终端奖励 ,Bayes 最优预测可以被压缩到一个标量对数似然比。
其中 是某层隐藏状态, 与 是正确与错误样本在隐藏状态空间中的条件分布, 是用于二值预测的对数似然比。这个式子不是训练损失,而是可行性论证:只要存在能够区分 的条件密度,Bayes 最优决策统计量就是一维标量。相比全维度探针,它说明奖励信息原则上不需要占据大量神经元;叠加假说进一步提供了实现层面的理由,即重要且频繁出现的特征可能获得稀疏专门表示。若隐藏状态维度很高而样本不足,真实密度比难以估计;若目标是连续过程奖励而非二值终端奖励, 不再是单一充分统计量,但 TD 误差同样是一维标量,因此低维直觉仍然成立。
核心构造:用TD目标找到价值神经元与多巴胺神经元
为了从隐藏状态中提取价值信号,论文采用两层MLP探针,输入维度等于某一 Transformer 层的隐藏维度,输出为标量。探针训练目标不是直接拟合最终奖励,而是最小化时序差分误差的平方。设第 层探针输出为 ,在终止步令 ,在中间步令 ,训练目标为:
其中 是生成数据的初始问题分布, 是探针接入的 Transformer 层, 是步级时序差分误差。相比直接以 为标签做分类,该目标让每一步的价值预测满足 Bellman 型一致性:中间步要求当前价值与下一步价值之差匹配折扣变化,终止步才匹配外部奖励。若把折扣因子 置零,中间TD变成负的前一步价值,时间信用分配被切断;若只用终端奖励,附录 Table 5 显示其定位的神经元干预后平均准确率仅从75.2降到66.4,而TD目标对应20.3,说明TD目标更能找出因果关键的少数神经元。论文附录 Table 7 给出的训练设置中 ,接近不折扣,但目标形式仍然依赖逐步一致性而非单一终端标签。

Figure 1 对应正文第3.3节,报告 Qwen-2.5-14B-SimpleRL-Zoo 在 GSM8K 与 MATH500 上第2到4层的价值探针剪枝曲线。曲线在剪枝比例很高时仍保持相对平稳,这正是论文宣称“不到百分之一神经元即可支持价值预测”的核心证据。需要注意,这个AUC是在初始输入位置 上评估的,模型尚未生成答案,因此绝对数值偏温和;附录第I节进一步报告在最终响应位置 上AUC多稳定在0.8以上。这说明价值神经元不是在单个位置短暂闪现,而是贯穿生成过程。
对多巴胺神经元,论文把生成过程从 token 级提升到 paragraph 级。对于段落边界状态 ,作者通过Monte Carlo rollout估计价值 ,并定义:
其中 是段边界的蒙特卡洛价值估计, 是段落数, 是折扣因子。这个 是外部标签,用来刻画一个段落是否意外提升或损害最终正确概率。与前面价值探针内部TD不同,这里的误差不是探针自身的自举量,而是由多次 rollout 计算得到的监督信号。若 接近1且估计准确,正的 表示段落带来意外进展,负的 表示逻辑受损;若段落划分粗糙或 rollout 估计噪声过大,多巴胺探针可能学到伪误差。论文明确只在强信号段落上训练和评估,并采用 的阈值。
多巴胺探针本身的训练目标是让探针预测 :
其中 是第 层隐藏状态上的多巴胺探针输出,平方误差把探针拉向段级TD标签。这个目标定义了 dopamine neurons 的搜索空间:探针输入维度很大,但损失只关心一个标量,因此论文可以用同样的L1剪枝流程找出贡献最大的少数神经元。若去掉附录第F节描述的隐藏状态归一化,整句或整段的总体激活水平会掩盖段间变化;论文采用跨 token 的z-score归一化,并把激活聚合到段落级,这与多巴胺神经响应常以一段时间窗口内平均发放率观察的类比保持一致。

Figure 3 是第4.4节的可视化证据。论文以 Qwen-2.5 模型第5层第1517个神经元为例,在正意外案例中,当模型识别出关键逻辑步骤时神经元出现激活峰值;在负意外案例中,当模型中途犯错时出现低谷。这个图没有给出定量阈值,但它弥补了 Spearman 曲线之外的行为解释:多巴胺神经元确实会在推理轨迹上呈现类似预测误差的起伏。附录第G节在 Minerva Math 上重复了该神经元,进一步说明可视化不是单个数据集的偶然。
依据、边界与代价:因果干预如何支撑子系统解释
论文最关键的证据不是探针性能,而是神经元级干预。作者对 Qwen-2.5-7B-SimpleRL-Zoo 在第2到5层零化价值探针识别出的前1%神经元,并比较随机神经元、Magnitude、Wanda 和 next-token prediction 神经元。Table 2 报告了 MATH500 准确率:
| 层 | 价值神经元 | 随机 | NTP 神经元 | Magnitude | Wanda |
|---|---|---|---|---|---|
| 2 | 37.0 (-38.2) | 77.0 (+1.8) | 76.4 (+1.2) | 74.6 (-0.6) | 74.8 (-0.4) |
| 3 | 13.6 (-61.6) | 73.4 (-1.8) | 76.8 (+1.6) | 61.6 (-13.6) | 48.2 (-27.0) |
| 4 | 29.4 (-45.8) | 73.8 (-1.4) | 77.4 (+2.2) | 75.4 (+0.2) | 67.0 (-8.2) |
| 5 | 1.2 (-74.0) | 74.4 (-0.8) | 75.2 (+0.0) | 75.0 (-0.2) | 73.4 (-1.8) |
| Avg | 20.3 (-54.9) | 74.6 (-0.6) | 76.4 (+1.2) | 71.6 (-3.6) | 65.8 (-9.4) |
Table 2 显示,原始准确率为75.2。零化价值神经元造成灾难性下降,平均准确率只有20.3;相比之下,随机零化平均仍为74.6,NTP神经元甚至平均略高。Magnitude和Wanda是结构重要性基线,也远低于价值神经元的破坏程度。更重要的是,NTP探针识别出的神经元与价值神经元的重叠只有0.7%,接近随机基线0.5%,这排除了一种常见反驳:这些神经元只是所有探针都会挑中的“大权重”或“重要结构”神经元。它们更像是被奖励目标特异激活的功能子集。
论文还做了子系统层面的功能耦合检验。附录第H节将早期层的价值神经元零化后观察后续层多巴胺神经元的激活轨迹,结果是随机神经元零化影响很小,而价值神经元零化会改变多巴胺神经元的峰谷位置。这支持“value 与 dopamine 不是两个孤立列表,而是在 reward 子系统中相互耦合”的解释。若没有这一步,多巴胺神经元可能只是后验相关;若没有跨任务IoU,价值神经元可能是探针选择噪声。论文因此同时给出局部因果和全局稳定性证据。

Figure 2 对应第3.5节,报告 Qwen-2.5-14B-SimpleRL-Zoo 第3层在 GSM8K、MATH500 和 ARC 上识别出的价值神经元之间的IoU曲线。曲线明显高于随机基线,并在剪枝比例接近1时快速上升。这个细节很重要:真正稳定的往往不是“所有入选神经元”,而是排名靠前的核心集合。论文还比较了同一基座模型经不同RL方法训练后的位置迁移,说明价值神经元对训练路径差异具有一定保留度。
实验与证据
论文的应用实验把机制发现转化为可操作接口。第一类应用是信心预测。由于价值神经元可以在生成前从 处预测价值,作者将 与终端奖励 比较,以AUC衡量信心预测能力。Table 3 报告了四种模型在 MATH500 和 ARC 上的结果,其中价值神经元AUC在最优剪枝比例下平均于第2到4层:
| 任务 | 模型 | 价值神经元 | LCD | 口头信心 | Token信心 | 问题长度 |
|---|---|---|---|---|---|---|
| MATH500 | Llama-3.1-8B | 0.69 | 0.64 | 0.69 | 0.54 | 0.63 |
| MATH500 | Phi-3.5-mini | 0.73 | 0.63 | 0.54 | 0.41 | 0.62 |
| MATH500 | Gemma-3-4B | 0.72 | 0.65 | 0.62 | 0.41 | 0.71 |
| MATH500 | Qwen3.5-0.8B | 0.71 | 0.70 | 0.41 | 0.56 | 0.77 |
| ARC | Llama-3.1-8B | 0.66 | 0.56 | 0.55 | 0.49 | 0.55 |
| ARC | Phi-3.5-mini | 0.63 | 0.54 | 0.29 | 0.46 | 0.54 |
| ARC | Gemma-3-4B | 0.59 | 0.50 | 0.47 | 0.44 | 0.49 |
| ARC | Qwen3.5-0.8B | 0.63 | 0.54 | 0.55 | 0.50 | 0.65 |
| Average | 全部设置 | 0.67 | 0.60 | 0.52 | 0.48 | 0.62 |
Table 3 显示,价值神经元平均AUC为0.67,高于LCD的0.60、口头信心的0.52、Token信心的0.48和问题长度代理的0.62。这个优势不能简单归因于“探针更复杂”,因为LCD也是在全隐藏状态上训练,而价值神经元只使用少数维度。不过论文也暴露了实际部署边界:问题长度在个别模型任务组合上更强,例如Qwen3.5-0.8B在MATH500上为0.77,高于价值神经元的0.71。因此,若工程目标是极端简单代理,长度仍值得作为baseline;价值神经元的优势更多体现在跨模型平均和维度稀疏性上。
第二类应用是过程奖励模型。多巴胺神经元预测段级 ,因此可以充当内部PRM。作者采用引导搜索:每个段落边界生成 个候选,用探针打分,选择最高分候选继续推理。Table 4 报告 Qwen-2.5-7B-SimpleRL-Zoo 在 MATH500 验证子集上的结果:
| 方法 | 贪心解码 | 随机候选 | 隐式PRM | 多巴胺神经元 |
|---|---|---|---|---|
| 准确率 | 72.2 | 72.2 | 75.0 | 77.8 |
Table 4 显示,多巴胺神经元从贪心解码的72.2提升到77.8,也比隐式PRM的75.0高2.8个百分点。隐式PRM的动机来自 KL 约束强化学习中 可近似奖励的理论,但这里论文直接利用内部探针的TD误差信号。这个结果的意义是:奖励子系统不只是被“读懂”,还可以被“用”于推理时搜索。证据边界也很明确:实验只在MATH500验证子集和单一模型上进行, 且未展示候选数扫描,因此不能外推到所有推理场景。
Figure 4 对应第4.3节,报告 Qwen-2.5-7B 和 Qwen-2.5-14B 在 MATH500 上多巴胺神经元的 Spearman 相关剪枝曲线。论文没有给出一个可直接比较主表那样的数值,只说明曲线在大范围剪枝比例下保持基本不变。这个证据支持多巴胺神经元与价值神经元一样稀疏,但它的说服力弱于干预实验,因为 Spearman 相关可以受标签噪声和阈值选择影响。论文采用 的段落筛选来增强信号,却没有在正文中给出该阈值的敏感性分析;这个缺失意味着 dopamine neuron 的稳定性至少部分依赖于人为定义“有意义步长变化”的方式。
深度洞察与总结
本文最重要的贡献不是提出一个复杂新算法,而是把已有黑盒探针结果推进为神经元级可解释系统。它给出三重证据链:第一,剪枝后AUC与Spearman曲线在极高剪枝比例下保持,说明信号稀疏;第二,价值神经元零化造成远超随机和结构重要性基线的性能崩塌,说明这些神经元不是泛泛的重要神经元;第三,跨数据集、跨模型IoU和早期层消融影响后续多巴胺神经元,说明它们具备迁移性和功能耦合。应用层面,价值神经元可作为轻量信心估计器,多巴胺神经元可作为内部PRM,把机制可解释性直接接到推理时控制。
论文仍有具体且可证伪的边界。首先,它依赖可验证的终端奖励,主体任务为数学、常识推理、代码和指令跟随,但没有在开放式生成或主观偏好任务上验证;作者也在附录第K节承认这一点。其次,实验主要在0.8B到14B模型上进行,论文未检查32B以上模型是否同样存在稳定价值神经元。再次,多巴胺神经元的训练标签来自段落级Monte Carlo估计,论文未给出rollout数量 的具体取值,也未对 阈值做系统消融,这可能影响步级标签质量。最后,过程奖励模型实验只在MATH500验证子集上以 搜索,尚未证明跨领域、跨预算或对抗扰动下仍稳健。
未来的可行方向应围绕“把稀疏子系统变成可控接口”展开。可以比较神经元基与SAE特征在奖励子空间稳定性上的差异,检验value/dopamine是坐标轴对齐还是方向叠加。也可以研究价值神经元在RLHF、安全微调或拒绝采样中的迁移,判断外部奖励优化是否会重塑该子系统。更工程化的一步是把价值神经元信心分数与多巴胺神经元PRM分数联合起来,用于自适应计算预算:初始价值低时减少搜索,中段出现正TD时扩展分支,出现负TD时回滚段落。这些判断都直接来自论文的干预与应用证据,而不是对模型内部机制的泛泛推测。
