[ICLR 2025] ACTOR-CURATOR:通过策略提升老虎机实现 LLM 强化学习的自动化课程演进
Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training
本文提出了 ACTOR-CURATOR (AC),一种用于大语言模型(LLM)强化学习后训练的可扩展自动化课程学习框架。该方法通过训练一个神经管理模型(Curator),利用在线随机镜像下降(OSMD)算法在非平稳多臂老虎机框架下动态优化问题选择,直接最大化预期的策略性能提升。
TL;DR
在 LLM 的强化学习(RL)后训练阶段,我们该给模型“喂”什么样的问题?传统的均匀采样不仅低效,还容易导致训练不稳定。来自 Caltech 和伊利诺伊大学等机构的研究者提出了 ACTOR-CURATOR (AC) 框架。它通过训练一个“神经管理员(Curator)”来实时判断哪些问题最能带来性能提升,将课程学习(Curriculum Learning)从人工调优进化为端到端的在线优化。实验表明,AC 在复杂推理任务上最高提速 80%,性能提升超过 30%。
痛点深挖:为什么均匀采样不再够用?
在大规模强化学习后训练(RL Post-training)中,数据池通常包含数十万个异构问题(如 Countdown, MATH, ARC)。
- 非平稳性 (Non-stationarity):随着模型(Actor)能力的增强,原本有挑战的问题变得简单,数据对模型的“营养价值”在不断衰减。
- 反馈稀疏:只有被选中的问题才有反馈,未选问题的潜力是未知的(典型的 Exploration-Exploitation 困境)。
- 规模限制:依赖人工难度标注(Easy/Hard)无法扩展到百万量级的数据。
核心机制:演化中的“管理员” (Methodology)
1. 策略提升作为学习信号
ACTOR-CURATOR 的天才之处在于它不直接预测问题的难度,而是预测问题的 “功劳分配” (Credit Assignment)。作者推导了一个 per-problem utility 公式,衡量如果 Actor 在问题 上进行更新,会对全局评测集的性能 产生多大的边际贡献。
2. OSMD 与神经函数近似
为了处理海量问题,框架引入了 在线随机镜像下降 (Online Stochastic Mirror Descent, OSMD)。
- 为了解决计算效率,采用两阶段采样:先从大数据池中随机抽一个 Candidate Batch,再由 Curator 对此 Batch 进行重加权(Curation Step)。
- PCO 更新:借鉴 PPO 的思想,对 Curator 的更新也进行了剪切(Proxy Clipping),防止数据分布剧烈抖动导致训练崩溃。
图 1:ACTOR-CURATOR 协同进化训练环路:Actor 更新后,利用 Advantage 信号计算 Utility 并训练 Curator。
实验与结果对比
1. 爆发式的效率提升
在多个基准测试中,AC 表现出了极强的“超车”能力。在 Zebra 逻辑推理任务中,它仅需约 20 个 Step 就能达到 Uniform 采样在 100 Step 时的性能。
图 2:训练加速对比。AC 以更少的 Step 达到了更高的测试准确率。
2. 难度曲线的自动涌现
观察发现,Curator 会在训练初期优先选择简单(Success Rate 高)的问题,随着训练进行,注意力逐渐转移到高难度问题上。这种“从易到难”的曲线不是人工设计的,而是为了最大化策略提升而自动优化出来的结果。
图 3:被选中问题的难度随训练步数自动升高。
深度洞察:为什么有效?
传统的课程学习(如 PCL)关注的是问题的绝对难度(例如寻找成功率 50% 的样本)。而 ACTOR-CURATOR 关注的是梯度信息。
- 实验显示,AC 选出的样本能诱导出更大幅度且更具持续性的 Actor Gradient Norm(见原文图 6),这意味着选出的题目确实包含了更多“未被模型掌握”的知识,从而让权重更新更有力。
局限性与总结
- 奖励依赖:目前高度依赖于可验证奖励(Verifiable Rewards,如数学/代码),在开放式文本对齐中效果尚待验证。
- 计算开销:训练一个额外的 Curator LLM 会增加约 9%-14% 的时间,但在大幅缩短的收敛步数面前可以忽略不计。
总结 (Takeaway): ACTOR-CURATOR 标志着 LLM 后训练从“静态数据工程”向“动态策略优化”的转变。它告诉我们,训练数据不应该是死板的,它应该是 Actor 的影子,随着 Actor 的成长而实时进化。
