[Google Research] 预训练、SFT 与 RL 的数据炼金术:为何推理模型需要不同的数据配方?
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
本文通过线性回归的 In-context Weight Prediction 任务,首次从理论上揭示了 LLM 预训练、SFT(监督微调)与 RL(强化学习)在数据质量与规模上的协同效应。研究指出,SFT 适用于通过少量、与预训练分布有差异的“硬例子”激活模型潜能,而 RL(结果监督)则依赖大规模、难度适中的数据来克服极其尖锐(Sharp)的优化景观。
TL;DR
在追求 OpenAI o1 或 DeepSeek-R1 式推理能力的路上,开发者面临 SFT 和 RL 的数据选择难题。本文通过严谨的数学推导给出了肯定的结论:SFT 应该“少而精”,专注于模型不会的硬题目;而 RL 则需要“大而全”,用海量反馈去磨平优化的“断头崖”。
核心洞察:从预训练到后训练的权衡
传统观点认为数据越多越好,但在后训练(Post-training)阶段,这个逻辑被打破了。作者发现,预训练本质上是在模型内部建立了一个“潜在能力池”,而后的 SFT 和 RL 扮演着不同的角色:
- SFT (Supervised Fine-Tuning):类似于“点火”,用极高质量的 CoT(思维链)路径激活模型。
- RL (Reinforcement Learning):类似于“修剪”,通过结果反馈(Outcome Supervision)让模型在多步推理中保持稳定。
1. 为什么 SFT 数据多了反而有害?
论文提出一个惊人的直觉:SFT 存在“干扰效应(Interference)”。
如图 1 所示,当 SFT 数据量(B)增加时,测试误差会经历一个类似“双下降”的过程。作者证明,如果 SFT 数据的分布与预训练数据存在重叠但又不完全一致(干涉项 r ≠ 0),模型在学习新任务的同时,会因为过度参数化而破坏预训练中已有的、更有用的信号。

Insight 1:SFT 的最佳配方是挑选那些预训练模型表现最差(Hard Samples)且数量可控的数据。盲目堆砌数据只会引发“知识稀释”。
2. RL 的挑战:在“尖锐的悬崖”边训练
与 SFT 不同,RL(在文中以 Outcome Supervision 模拟)被证明对数据量极度饥渴。其背后的物理直觉在于优化景观(Optimization Landscape)的极度恶化。
作者推导了 RL 的 Hessian 矩阵谱半径,发现其曲率随推理步数 指数级增加:
这意味着:
- 优化难度极大:RL 的景观充满了“断头崖”(High-curvature CLIFFS),微小的步长设置不当就会导致模型崩溃。
- 数据多样性的必要性:为了不让模型跌落悬崖,必须使用海量的数据来“平滑”这一景观。
图中 (a) 显示 SFT 存在 U 型拐点,而 (f) 显示 OS 损失随样本量 B 增加而持续下降。
3. 预训练的价值:为了后期能平稳“降落”
论文提出了 协同效应(Synergistic Effects) 的概念。如果预训练数据不够平衡(Imbalanced),模型在进入 RL 阶段时会初始化在极其不稳定的区域(Spectral Misalignment),导致即便之后有大量的 RL 反馈,模型也难以学会复杂推理技能,甚至会出现 inference 时的“过度思考”。
实验验证:从 LSA 到 GPT-2
作者不仅在简单的线性自注意力模型(LSA)上验证了定理,还在 9.5M 参数的非线性 GPT-2 模型上进行了实验,结果高度一致:
- SFT 实验:增加 context length (n) 或 sample size (B) 都会最终导致 U 型性能反弹(即性能变差)。
- RL 实验:性能随数据量增加而单调提升。

结论:推理模型的数据哲学
这篇论文为大模型开发者敲响了警钟:不要迷信万级以上的 SFT 数据量。
- SFT 阶段:应专注于“找补”。筛选出预训练模型最弱的环节,提供几百到几千组高质量、长路径的 CoT 即可。
- RL 阶段:应专注于“强化”。在模型已经能勉强答对的基础上,投入数以百万计的中等难度反馈,用规模化来对冲 RL 本身天然的不稳定性。
这一理论完美解释了为何最近的推理模型(如 DeepSeek-R1)在训练初期往往只使用极少量的“冷启动”SFT 数据,而将重心放在大规模 RL 训练上。
