RISE:透过 Readout 之眼,重塑 LLM 的数据归因与估值

Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation

总结
问题
方法
结果
要点
摘要

本文提出了 RISE (Readout Influence Sketching Estimator),一种针对大语言模型(LLM)的可扩展数据归因与估值方法。该方法通过 CountSketch 技术压缩输出层(LM Head)的梯度信号,成功在 32B 参数规模的模型上实现了高效的训练数据追溯与质量评估。

TL;DR

在处理数十亿参数的大语言模型(LLM)时,弄清楚“哪条训练数据影响了特定输出”一直是一项成本极高的任务。本文提出的 RISE (Readout Influence Sketching Estimator) 另辟蹊径:它不再盯着全量参数梯度,而是专注于模型输出的“最后一公里”——Readout 层(LM Head)。通过双通道语义分解与 CountSketch 压缩,RISE 不仅在 32B 模型上跑通了数据归因,存储成本还降低了两个数量级。

背景定位:数据归因的“扩展性陷阱”

在数据中心化的今天,模型性能极大程度上取决于数据质量。我们不仅需要追溯过去(回溯特定预测受哪些训练样本影响),更需要预知未来(在训练前评估候选数据的价值)。

然而,经典的梯度方法面临严重的不可扩展性:

  • 物理极限:存储 7B 模型的全量梯度(FP16)处理 10,000 个样本就需要近 140TB 硬盘。
  • 计算瓶颈:二阶 Hessian 矩阵在 LLM 面前几乎无法计算。

核心直觉:影响力热点(Influence Hotspots)

作者基于人类认知的启发:人类决策往往依赖于相关记忆的焦点提取,而非重放所有神经网络路径。通过实验,作者发现 LLM 存在一个显著物理特性:梯度能量在输出层高度集中

模型架构图

关键观察

  1. ** Readout 主导性**:随着模型规模扩大,LM Head 的梯度能量占比显著增加。在 OLMo-32B 中,输出层的能量密度是中间层的 27.8 倍。
  2. 外积分解:输出层的梯度可以分解为 ,其中 是词表残差, 是隐藏状态。这意味着我们不需要复杂的 Backpropagation 即可在 Forward Pass 中直接获取影响力特征。

方法论:双通道与稀疏草图

1. RH + GH 双通道引擎

为了平衡词法精度和语义鲁棒性,RISE 采用了双通道设计:

  • RH 通道 (Residual):直接在词表空间做比较,擅长捕获精确的 Token 匹配。
  • GH 通道 (Projected-Error):将残差投影回 Embedding 空间。它能识别出虽然词不同、但语义相近的错误(例如:将“Cat”预测为“Kitten”产生的惩罚应小于预测为“Stock”)。

2. Active-Token 稀疏性

作者观察到,虽然词表很大,但真正贡献能量的词(Active Tokens)极少。通过仅保留预测概率最高的前 K 个词和 Ground-truth 词,RISE 成功将处理维度从几万甚至十几万词缩减到了百级别,且几乎没有准确性损失。

需替换为架构图 (建议此处查看原文 Figure 1 的 RISE 整体流程)

3. CountSketch 压缩

为了进一步极致压缩,RISE 对分解后的向量因子分别进行 CountSketch 投影。这种方法是 Data-independent 的,无需像 PCA 那样提前训练投影矩阵,非常适合在大规模动态数据流中使用。


实验与战绩

SOTA 对比与存储优势

在 OLMo-32B 规模下,RISE 成为了唯一“能跑通”的方法。相比于之前的最强基线 RapidIn,RISE 在存储上的降幅可达 112x

实验结果对比

闭环实验:告别“脑残”(Brain Rot)数据

作者在一个现实场景中验证了价值:从 90% 的低质量(Brain Rot)数据中提取 10% 的精华。 使用 RISE 挑选的数据进行训练,相比于 Random 选择,困惑度(Perplexity)从 126 骤降至 2.33。这证明了 RISE 挑选出的不仅是看起来像的数据,而是对模型真正“有营养”的数据。


深度洞察:为什么有效?

RISE 的成功在于它抓住了 LLM 的归因分化(Inductive Bias)

  • 中间层在长期的预训练中逐渐趋向于表示的压缩与对齐,而最终的输出层则通过 LM Head 重新展现了判别力(U-shaped Discriminativeness)。
  • 传统的全参数归因包含了太多“背景噪音”,这些能量较低的中间层梯度可能反而干扰了真正具有区分度的信号。RISE 的“只看读出端”,实际上起到了降噪的作用。

总结与限制

RISE 为超大规模模型提供了一个实用的归因原语。虽然它目前主要关注 Readout 层,忽略了深层参数中的细微交互,但其实验结果足以证明:在绝大多数工业任务(后门检测、领域分离、质量筛选)中,Readout 信号已经足够支撑强大的判别力。

未来,如何将这种 Readout 归因与分布式存储进一步结合,甚至在训练过程中实时进行在线数据价值评估,将是 LLM 基础设施层的一个核心研究方向。

发现相似论文

试试这些示例

  • 查找最近其他利用 LLM 输出层表示或部分参数梯度来进行高效训练数据选择或归因的研究论文。
  • 哪篇论文最早在深度学习中提出了 CountSketch 或 Feature Hashing 用于梯度压缩,本文是如何将其与 LLM 的外积结构结合的?
  • 探讨 RISE 方法在多模态语言模型 (VLM) 训练数据评估中的应用潜力,是否存在类似 Readout 层的热点效应?
目录
RISE:透过 Readout 之眼,重塑 LLM 的数据归因与估值
1. TL;DR
2. 背景定位:数据归因的“扩展性陷阱”
3. 核心直觉:影响力热点(Influence Hotspots)
3.1. 关键观察
4. 方法论:双通道与稀疏草图
4.1. 1. RH + GH 双通道引擎
4.2. 2. Active-Token 稀疏性
4.3. 3. CountSketch 压缩
5. 实验与战绩
5.1. SOTA 对比与存储优势
5.2. 闭环实验:告别“脑残”(Brain Rot)数据
6. 深度洞察:为什么有效?
7. 总结与限制