Token Cleaning:告别冗余,LLM 指令微调进入“Token 原子级”时代

Token cleaning: Fine-grained data selection for llm supervised fine-tuning

2025-01-01
Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, Yang Liu
总结
问题
方法
结果
要点
摘要

本文提出了 Token Cleaning,一种针对大语言模型指令微调(SFT)的细粒度数据选择方法。通过对比基础模型与参考模型的 Token 级影响(Influence),该方法能有效识别并过滤掉冗余或无信息的 Token,在 3B-8B 规模模型上实现了显著的性能提升。

TL;DR

在 Supervised Fine-Tuning (SFT) 阶段,并非所有的 Token 都生而平等。本文提出了一种 Token Cleaning 管线,通过计算 Token 级的影响力得分,精准剔除那些“毫无养分”的冗余 Token。实验证明,即使是在精选的高质量数据集中,过滤掉 30%-40% 的 Token 反而能让模型在 downstream 任务上表现得更好。

背景:样本级清洗的局限性

目前学术界和工业界的共识是:SFT 数据质量远比数量重要(Quality > Quantity)。现有的 SFT 数据筛选方法(如难度评估、语义多样性过滤)大多是以“样本”为最小单位的。

然而,作者指出:即便是一个高质量的回答,也充满了噪声。

  • 预训练残留:预训练阶段已经学烂了的常用表达(如 "The", "is", "I'm sorry but...")。
  • 冗余信息:与任务核心逻辑无关的连接词或背景套话。
  • 噪声干扰:这些 Token 在训练时会产生梯度偏移,稀释了关键任务信号。

核心直觉:从噪声标签视角看 SFT

如果我们把 SFT 看作是一个“标签预测”过程,那么每个 Token 就是一个标签。既然并不是每个 Token 都有助于模型对齐,那么那些无信息的 Token 就可以被视为噪声标签

影响力驱动的评分机制 (Influence-Guided Scoring)

如何判断一个 Token 是不是“好”的?作者使用了 Influence 概念: 其中 是原始的基础模型, 是微调后的参考模型。

  • 如果 对该 Token 的预测效果远好于 ,说明这个 Token 蕴含了大量微调阶段才学到的“新知识”,质量高。
  • 如果两者表现一致,说明这只是个预训练模型早就会了的“通用 Token”,价值低。

Token Cleaning 流程图

两种进化路线

  1. Fixed-Model Cleaning:固定参考模型,对全量数据一次性“收割”。
  2. Self-Evolving Cleaning:边练边选。先用一部分数据热身,用热身得到的模型去清洗下一批数据,迭代演化。作者发现这种方式能产生“马太效应”:强的任务领域清洗得越来越准,模型在关键任务上的表现显著拉升。

实验战绩与深度洞察

作者在 LLaMA-3.2-3B、LLaMA-3.1-8B 和 Mistral-7B 上进行了广泛测试。

1. 全球排名优于局部排名

相比于此前的 RHO 方法(在每个样本内固定比例删除 Token),本文支持 Global Ranking(全数据集 Token 统一排队)。这样可以彻底放弃整个坏样本,而保留好样本中几乎所有的 Token。

实验结果对比表

2. 70% 是魔数

通过消融实验(Ablation Study),作者发现保留 60%-70% 的 Token 能达到性能峰值。这不仅节省了计算资源(虽然目前实现主要关注效果,训练时间缩减尚不明显),更重要的是证明了 SFT 阶段数据存在极大的“通胀”。

消融实验图

结论:少即是多 (Less is More)

Token Cleaning 并非简单的“删减”,它本质上是提升信噪比 (SNR)

  • 理论贡献:本文提供了严谨的误差上界证明(Theorem 5.1),解释了为什么数据质量的提升可以补偿数据数量的减少。
  • 实践意义:它为未来高效 SFT 提供了一个新思路——我们不需要全量微调 response 中的每一个词,只需聚焦于那些能带给模型“启发”的关键 Token。

局限与展望

尽管性能优秀,但目前的 Token Cleaning 在训练效率(Training Speedup)上仍有提升空间。目前的实现是基于 Mask 的,虽然屏蔽了 Loss 计算,但计算图中依然保留了这些 Token。未来如何实现真正的“稀疏训练”以大幅缩短 SFT 时间,是该领域极具潜力的研究方向。

发现相似论文

试试这些示例

  • 查找其他最近试图在 LLM 微调过程中通过 Token 级别加权或过滤来提高训练效率的论文。
  • 哪篇论文最早引入了 Rho-loss 或类似的通过 Loss 差值衡量样本重要性的方法,本文在 SFT 场景下做了哪些本质改进?
  • 除了文本生成,是否有研究将这种细粒度的 Token 清洗技术应用到多模态模型(如图像 Patch 筛选)的微调任务中?
目录
Token Cleaning:告别冗余,LLM 指令微调进入“Token 原子级”时代
1. TL;DR
2. 背景:样本级清洗的局限性
3. 核心直觉:从噪声标签视角看 SFT
3.1. 影响力驱动的评分机制 (Influence-Guided Scoring)
4. 两种进化路线
5. 实验战绩与深度洞察
5.1. 1. 全球排名优于局部排名
5.2. 2. 70% 是魔数
6. 结论:少即是多 (Less is More)
7. 局限与展望