[ICLR 2025] ACTOR-CURATOR:通过策略提升老虎机实现 LLM 强化学习的自动化课程演进

Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training

总结
问题
方法
结果
要点

本文提出了 ACTOR-CURATOR (AC),一种用于大语言模型(LLM)强化学习后训练的可扩展自动化课程学习框架。该方法通过训练一个神经管理模型(Curator),利用在线随机镜像下降(OSMD)算法在非平稳多臂老虎机框架下动态优化问题选择,直接最大化预期的策略性能提升。

TL;DR

在 LLM 的强化学习(RL)后训练阶段,我们该给模型“喂”什么样的问题?传统的均匀采样不仅低效,还容易导致训练不稳定。来自 Caltech 和伊利诺伊大学等机构的研究者提出了 ACTOR-CURATOR (AC) 框架。它通过训练一个“神经管理员(Curator)”来实时判断哪些问题最能带来性能提升,将课程学习(Curriculum Learning)从人工调优进化为端到端的在线优化。实验表明,AC 在复杂推理任务上最高提速 80%,性能提升超过 30%。

痛点深挖:为什么均匀采样不再够用?

在大规模强化学习后训练(RL Post-training)中,数据池通常包含数十万个异构问题(如 Countdown, MATH, ARC)。

  • 非平稳性 (Non-stationarity):随着模型(Actor)能力的增强,原本有挑战的问题变得简单,数据对模型的“营养价值”在不断衰减。
  • 反馈稀疏:只有被选中的问题才有反馈,未选问题的潜力是未知的(典型的 Exploration-Exploitation 困境)。
  • 规模限制:依赖人工难度标注(Easy/Hard)无法扩展到百万量级的数据。

核心机制:演化中的“管理员” (Methodology)

1. 策略提升作为学习信号

ACTOR-CURATOR 的天才之处在于它不直接预测问题的难度,而是预测问题的 “功劳分配” (Credit Assignment)。作者推导了一个 per-problem utility 公式,衡量如果 Actor 在问题 上进行更新,会对全局评测集的性能 产生多大的边际贡献。

2. OSMD 与神经函数近似

为了处理海量问题,框架引入了 在线随机镜像下降 (Online Stochastic Mirror Descent, OSMD)

  • 为了解决计算效率,采用两阶段采样:先从大数据池中随机抽一个 Candidate Batch,再由 Curator 对此 Batch 进行重加权(Curation Step)。
  • PCO 更新:借鉴 PPO 的思想,对 Curator 的更新也进行了剪切(Proxy Clipping),防止数据分布剧烈抖动导致训练崩溃。

模型架构图 图 1:ACTOR-CURATOR 协同进化训练环路:Actor 更新后,利用 Advantage 信号计算 Utility 并训练 Curator。

实验与结果对比

1. 爆发式的效率提升

在多个基准测试中,AC 表现出了极强的“超车”能力。在 Zebra 逻辑推理任务中,它仅需约 20 个 Step 就能达到 Uniform 采样在 100 Step 时的性能。

实验结果对比 图 2:训练加速对比。AC 以更少的 Step 达到了更高的测试准确率。

2. 难度曲线的自动涌现

观察发现,Curator 会在训练初期优先选择简单(Success Rate 高)的问题,随着训练进行,注意力逐渐转移到高难度问题上。这种“从易到难”的曲线不是人工设计的,而是为了最大化策略提升而自动优化出来的结果。

难度演进 图 3:被选中问题的难度随训练步数自动升高。

深度洞察:为什么有效?

传统的课程学习(如 PCL)关注的是问题的绝对难度(例如寻找成功率 50% 的样本)。而 ACTOR-CURATOR 关注的是梯度信息。

  • 实验显示,AC 选出的样本能诱导出更大幅度且更具持续性的 Actor Gradient Norm(见原文图 6),这意味着选出的题目确实包含了更多“未被模型掌握”的知识,从而让权重更新更有力。

局限性与总结

  • 奖励依赖:目前高度依赖于可验证奖励(Verifiable Rewards,如数学/代码),在开放式文本对齐中效果尚待验证。
  • 计算开销:训练一个额外的 Curator LLM 会增加约 9%-14% 的时间,但在大幅缩短的收敛步数面前可以忽略不计。

总结 (Takeaway): ACTOR-CURATOR 标志着 LLM 后训练从“静态数据工程”向“动态策略优化”的转变。它告诉我们,训练数据不应该是死板的,它应该是 Actor 的影子,随着 Actor 的成长而实时进化。

发现相似论文

试试这些示例

  • 查找其他将课程学习(Curriculum Learning)应用于大语言模型推理任务强化学习(如 DeepSeek-R1 或类似 R1-Zero 架构)的最新研究论文。
  • 哪篇论文最早在强化学习中提出了性能差异恒等式(Performance Difference Identity),本文是如何将其扩展到离散问题选择的老虎机框架中的?
  • 探讨除了推理和数学领域,这种基于 Policy-Improvement 的动态数据筛选机制是否已应用在多模态理解或长文本生成的后训练任务中?
目录
[ICLR 2025] ACTOR-CURATOR:通过策略提升老虎机实现 LLM 强化学习的自动化课程演进
1. TL;DR
2. 痛点深挖:为什么均匀采样不再够用?
3. 核心机制:演化中的“管理员” (Methodology)
3.1. 1. 策略提升作为学习信号
3.2. 2. OSMD 与神经函数近似
4. 实验与结果对比
4.1. 1. 爆发式的效率提升
4.2. 2. 难度曲线的自动涌现
5. 深度洞察:为什么有效?
6. 局限性与总结