[MIT CSAIL] Neural Thickets:后训练不再需要梯度?随机采样竟能比肩 RLHF
Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
本文提出了“神经丛生态”(Neural Thickets)理论,指出大型预训练模型的权重邻域内天然密集且多样地分布着任务专家。基于此发现,作者提出了一种极其简单、全并行的后训练方法 RandOpt:通过随机采样 N 个参数扰动,筛选前 K 个并在推理时进行集成,该方法在 LLM 任务上比肩 PPO 和 GRPO 等复杂强化学习算法。
TL;DR
在一篇极具启发性的论文中,来自 MIT CSAIL 的研究者们向“梯度下降是唯一真理”的信条发起挑战。他们发现,对于足够大的预训练模型,其权重周围并不是荒漠,而是一片“神经丛(Neural Thickets)”——到处都是已经成型的任务专家。基于此,他们提出的 RandOpt 方法通过简单的“随机猜+选拔+集成”,在多个 Benchmarks 上击败了主流的 PPO 和 GRPO 强化学习算法。
背景定位
这是对 Lottery Ticket Hypothesis(彩票假设) 在预训练时代的全新解读。如果说彩票假设认为初始化中隐藏了中奖子网,那么 Neural Thickets 则证明:一旦模型经过充分预训练,你就已经赢了彩票,而且满手都是中奖票。
痛点与动机:为什么“瞎猜”现在行得通?
长期以来,随机搜索(Random Guessing)被认为在机器学习中是无效的。然而作者观察到一个关键的拓扑转变:
- 小模型(Needle in a Haystack):解的密度极低,必须依靠梯度下降精确导航。
- 大模型(Thicket Regime):随着规模增加,预训练权重周边的解密度急剧上升。
作者通过 Spectral Discordance(光谱不一致性) 证明,这些随机采样的“专家”具有多样性(Specialists),它们各自擅长不同的子任务,而预训练权重恰恰是这些专家的交汇点。
方法论详解:RandOpt 的奥义
RandOpt 的流程简单到令人发指,完全不需要反向传播:
- 随机采样 (Sampling):在预训练权重 周围加入高斯噪声 ,生成 个模型变体。
- 筛选 (Checking):在极简的训练集(如 200 个样本)上跑一遍,选出得分最高的 个。
- 集成 (Ensembling):推理时,让这 个变体投票。
图 1:RandOpt 的 O(1) 训练流程与小模型 vs 大模型的解密度对比图
这里的核心直觉是:预训练已经完成了 99.9% 的定向工作,我们只需要在终点站附近稍微扩散一下,就能找到针对特定任务(如数学或化学)的最优专家。
实验与结果:暴力美学的胜利
作者在 Qwen2.5、Llama 3.1 和 OLMo3 等多个模型系列上进行了严苛测试。
1. SOTA 对比
在等效的 FLOPs 预算下,RandOpt 几乎在所有数学和编程任务上都与 PPO、GRPO 旗鼓相当,甚至在 Qwen2.5-3B 上显著胜出。
图 2:RandOpt 与主流 RL 算法在不同规模模型上的性能对比,可以看到随规模增加 RandOpt 的优势越发明显
2. 消融实验:集成的重要性
实验表明, 的集成效果显著优于单一最佳扰动()。这验证了“丛林”中的专家确实是各司其职,集成能够通过互补效应覆盖更广的推理路径。
3. “格式丛林” vs “推理丛林”
作者对 GSM8K 提升的原因进行了深度拆解。有趣的是,一部分提升来自于“格式修正”(让模型学会正确的 #### 输出格式),但更大的一部分来自于“硬核推理能力”的提升,这证明了随机扰动确实触及了模型深层的逻辑处理能力。
深度洞察与总结
核心贡献
- 提出了 Neural Thickets 的概念,量化了模型规模与解密度之间的正相关 Scaling Law。
- 证明了后训练可以从“顺序优化”转变为“并行采样”,这极大缩短了训练的壁钟时间。
局限性
- 推理成本:标准的 RandOpt 需要 次前向传播。虽然作者提供了蒸馏方案(Distillation),但增加了额外步骤。
- 从零训练不可用:该方法完全依赖于强大的预训练表征,无法用于基础模型的预训练过程。
未来展望
Neural Thickets 可能会改变我们对“基础模型”的定义:它不再是一个静态的参数点,而是一个动态的潜力分布。未来的 AI 产品可能会根据用户 query 实时采样出一群微小型专家,通过群体智能解决复杂难题。
主编点评:在习惯了追求更复杂的损失函数和优化器的今天,RandOpt 用最原始的随机性给工业界上了一课:只要你的模型足够大,幸运女神就在家门口。
