[ARLArena] 破解智能体强化学习崩溃之谜:SAMPO 如何让 LLM Agent 训练稳如泰山?

ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

总结
问题
方法
结果
要点

本文提出了 ARLArena,一个针对智能体强化学习(ARL)的统一稳定训练框架。通过将策略梯度分解为四个维度并引入 SAMPO 算法,该研究在多回合交互任务(如 ALFWorld, WebShop)中实现了 SOTA 性能,相比 GRPO 基线平均提升了 25.2%。

TL;DR

智能体强化学习(Agentic RL, ARL)一直以来被视为 AI 训练的“玄学”,其高度的不稳定性常导致训练中途崩溃。ARLArena 提供了一套系统化的稳定训练方案,并推出了全新的策略优化算法 SAMPO。它通过序列级裁剪环境感知优势设计,在 4B 模型上跑出了超越顶尖闭源模型的智能体表现,平均性能提升达 25.2%

核心痛点:为什么 ARL 总是崩溃?

在静态推理(如数学)中,RL 已经取得了巨大成功(如 DeepSeek-R1)。但在多回合交互(Agentic)场景下,问题变得棘手:

  1. 错误级联:早期的一个微小动作失误会引发后续状态的偏移,导致信用分配(Credit Assignment)充满噪声。
  2. 裁剪失灵:传统的 PPO 或 GRPO 在 Token 级别进行重要性采样裁剪,这在长文本生成中无法限制整个序列的偏移。
  3. 格式坍塌:训练初期,模型极易因为无法生成正确的 <action> 格式而陷入死循环,导致负反馈信号淹没有效学习。

方法论:分解策略梯度的四个维度

为了找出不稳定的真凶,作者将策略梯度(Policy Gradient)拆解为四个关键维度进行消融实验:

  1. Loss Aggregation (损失聚合):对比 Token-mean 与 Seq-mean。
  2. IS Clipping (重要性采样裁剪):这是最关键的发现。
  3. Advantage Design (优势设计):引入环境状态反馈辅助判断。
  4. Dynamic Sampling (动态采样):过滤无效轨迹。

模型架构与分析框架 图 1:ARLArena 的系统化分析框架,从分解到统一方案 SAMPO。

核心发现 1:序列级裁剪是救命稻草

作者惊讶地发现,像 SAPO 或 CISPO 这样在 Token 级别采用“宽容裁剪”的方法在 ARL 中极易瞬间崩溃。结论是:必须使用序列级裁剪(Sequence-level Clipping)。通过约束整个 Action 序列的偏移量,可以有效抑制 Off-policy 带来的副作用。

核心发现 2:负优势轨迹的毒害

实验通过离群值分析发现,训练崩溃通常是由具有负优势(Negative Advantage)且 IS 比例极低的样本驱动的。针对此类样本实施 Sequence Masking 能显著稳定模型。

终极方案:SAMPO 算法

结合所有洞察,作者提出了 SAMPO (Stable Agentic Multi-turn Policy Optimization)

其中 是基于序列平均的 IS 比例,而 融合了全局奖励与局部步骤奖励。这种集成方案不仅解决了稳定性问题,还大大提升了学习速率。

训练曲线对比 图 2:在 ALFWorld 和 Sokoban 任务中,SAMPO(红线)表现出极佳的单调增长稳定性。

实验结果:开源 4B 逆袭闭源巨头

在 WebShop 和 ALFWorld 的严苛测试下,基于 Qwen-4B 的 SAMPO 模型展现了惊人的跨回合规划能力。

  • 性能提升:相比 GRPO 基线,在多回合任务中平均提升 25.2%
  • 越级对标:令人震惊的是,4B 规模的小模型在特定 ARL 任务上的成功率竟然压倒了 GPT-5.2 和 Gemini 2.5 Pro。这说明:对环境的深度对齐(Alignment)和稳定的 RL 训练,其价值远超单纯的模型参数缩放。

性能数据表 图 3:各维度方法在多任务下的详尽对比。

深度总结:通往稳定 ARL 的三部曲

根据 ARLArena 的实践,构建一个稳定的智能体训练流水线应遵循:

  1. 干净的初始化:通过行为克隆(BC)确保模型处在一个合理的行为流形(Manifold)上。
  2. 强制格式约束:在奖励函数中加入严格的格式罚分(Format Penalty)。
  3. 序列全局管控:放弃局部 Token 裁剪,拥抱序列级优化。

ARLArena 的出现,标志着 LLM Agent 的后训练(Post-training)正从“摸黑探索”走向“工程标准化”。对于开发者而言,这篇论文提供的不仅是算法,更是一套成熟的可复现 Pipeline。

发现相似论文

试试这些示例

  • 查找最近其他针对大模型智能体(LLM Agents)在多回合强化学习任务中解决训练崩溃(Training Collapse)问题的研究论文。
  • 哪篇论文最早提出了组内相对策略优化(GRPO),本文在 ARLArena 中是如何对其进行序列级改进的?
  • 有哪些研究将类似 SAMPO 的序列级裁剪机制应用到了机器人具体化(Embodied AI)或复杂软件调用任务中?
目录
[ARLArena] 破解智能体强化学习崩溃之谜:SAMPO 如何让 LLM Agent 训练稳如泰山?
1. TL;DR
2. 核心痛点:为什么 ARL 总是崩溃?
3. 方法论:分解策略梯度的四个维度
3.1. 核心发现 1:序列级裁剪是救命稻草
3.2. 核心发现 2:负优势轨迹的毒害
4. 终极方案:SAMPO 算法
5. 实验结果:开源 4B 逆袭闭源巨头
6. 深度总结:通往稳定 ARL 的三部曲