[ICLR 2025] 弱者竟能助强:WMSS 突破 SFT 饱和瓶颈,让强模型更强

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

总结
问题
方法
结果
要点
摘要

本文提出了 WMSS (Weak Agents Can Make Strong Agents Stronger),一种全新的大语言模型 Post-training 范式。通过引入历史弱模型(Weak Checkpoints)的 Logit 信号进行联合训练,该方法在不增加推理成本的前提下,显著突破了标准 SFT 的性能饱和瓶颈,在数学竞赛 (AIME) 和代码生成任务中取得了显著的 SOTA 提升。

TL;DR

在 AI 训练领域,我们通常认为“名师出高徒”。但本文提出了一项颠覆性观察:模型在成长过程中的“弱点”其实是进一步进化的阶梯。通过引入模型历史 Checkpoint 的 Logit MixingWMSS (Weak-Driven Learning) 成功在数学和代码任务中突破了标准 SFT 的性能天花板。在 Qwen3-8B 上,它让 AIME 数学竞赛表现直接翻倍,且 推理成本为零


痛点深挖:为什么 SFT 练到最后没效果了?

在 LLM 的 Post-training 阶段,开发者常发现模型进入“平台期”:Logit Margin(目标 Token 与其他 Token 的差距)迅速拉大并固化。此时,由于 Softmax 的特性,非目标 Token 的概率几乎为零,导致梯度消失。

简而言之:模型变得太自信了,以至于它已经不再去思考为什么“错误答案”是错的。 这种“决策边界僵化”限制了模型在处理复杂逻辑(如 AIME 竞赛题)时的精细推理能力。


核心方法论:弱驱动学习 (Weak-Driven Learning)

作者的直觉非常有意思:就像人类合作,一个顶级高手在带新手时,为了纠正新手的错误,往往会被迫对知识点进行更深层次的梳理。

1. 架构解析:Logit Mixing 放大梯度

WMSS 的核心操作是 联合训练 (Joint Training)。它将当前强模型(Current Strong Agent)与历史弱模型(Weak Reference)的 Logit 进行线性混合:

物理直觉:弱模型对某些“干扰项”仍保持较高的不确定性。通过混合 Logit,WMSS 强制将这些被强模型过早忽略的“硬负样本(Hard Negatives)”重新拉回决策视线。这不仅防止了梯度消失,还产生了一种“梯度屏蔽(Gradient Shielding)”效应,让强选手在饱和区继续磨练。

模型架构图

2. 课程学习:哪些数据值得重练?

并非所有数据都需要弱模型干预。作者提出了 CEDA (Curriculum-Enhanced Data Activation),通过计算弱/强模型之间的熵动力学(Entropy Dynamics)来筛选:

  • 回归修复 (Regression Repair):如果强模型比弱模型更不确定,说明发生了灾难性遗忘。
  • 巩固训练 (Consolidation):针对强模型虽然做对但边界脆弱的样本进行加权。

实验战绩:全线突破 SOTA

在 Qwen 家族模型上的实验显示了 WMSS 极强的泛化性:

  • 垂直领域跨越:在数学 Reasoning 任务中,Qwen3-8B 的平均分从 66.7% 提升至 72.9%。
  • 攻克高难任务:最令人吃惊的是 AIME 2025,该任务极具挑战性。通过 WMSS,4B 模型的表现甚至超越了普通的 8B SFT 基线。

实验结果对比

Logit 细节:为什么它有效?

通过统计发现,WMSS 并不是盲目拉高正确答案的得分,而是 极大地压制了背景干扰信号(Non-target logits 均值下降了 56.9%)。这相当于在原本嘈杂的信号中进行了精确的去噪,让决策边界变得极度清晰。


深度洞察:自我进化的未来

WMSS 的成功给行业留下了几个深刻启示:

  1. 废料即燃料:在模型训练迭代中产生的大量历史 Checkpoints 不应被视为“残次品”,它们是刻画模型认知薄弱环节的最佳镜像。
  2. 非对称监督:传统的“强拉弱(Distillation)”已经研究得很透彻,但“弱推强(Weak-driven)”可能才是大模型向 AGI 迈进、实现超越人类水平(Self-evolution)的关键路径。
  3. 局限性:尽管实验效果显著,但超参数 的选择对性能有一定影响。未来如何动态调整这种“弱信号”注入的强度,将是值得探索的方向。

总结:WMSS 证明了,大模型进化的关键,或许就藏在它们曾经犯过的错误和那些“不成熟的自我”之中。

发现相似论文

试试这些示例

  • 查找其他通过修改 Logit 分布或引入 Logit 空间噪声来解决大语言模型训练饱和(Optimization Saturation)问题的最新论文。
  • 哪篇论文最早探讨了 OpenAI 提出的 Weak-to-Strong Generalization 概念,本文的“弱驱动”逻辑与其在监督信号来源上有何本质区别?
  • 有哪些研究尝试将这种利用历史 Checkpoint 作为正则化项或梯度放大器的机制应用到多模态模型或强化学习 (RLHF) 的优化过程中?
目录
[ICLR 2025] 弱者竟能助强:WMSS 突破 SFT 饱和瓶颈,让强模型更强
1. TL;DR
2. 痛点深挖:为什么 SFT 练到最后没效果了?
3. 核心方法论:弱驱动学习 (Weak-Driven Learning)
3.1. 1. 架构解析:Logit Mixing 放大梯度
3.2. 2. 课程学习:哪些数据值得重练?
4. 实验战绩:全线突破 SOTA
4.1. Logit 细节:为什么它有效?
5. 深度洞察:自我进化的未来