[ARLArena] 破解智能体强化学习崩溃之谜:SAMPO 如何让 LLM Agent 训练稳如泰山?
ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning
本文提出了 ARLArena,一个针对智能体强化学习(ARL)的统一稳定训练框架。通过将策略梯度分解为四个维度并引入 SAMPO 算法,该研究在多回合交互任务(如 ALFWorld, WebShop)中实现了 SOTA 性能,相比 GRPO 基线平均提升了 25.2%。
TL;DR
智能体强化学习(Agentic RL, ARL)一直以来被视为 AI 训练的“玄学”,其高度的不稳定性常导致训练中途崩溃。ARLArena 提供了一套系统化的稳定训练方案,并推出了全新的策略优化算法 SAMPO。它通过序列级裁剪和环境感知优势设计,在 4B 模型上跑出了超越顶尖闭源模型的智能体表现,平均性能提升达 25.2%。
核心痛点:为什么 ARL 总是崩溃?
在静态推理(如数学)中,RL 已经取得了巨大成功(如 DeepSeek-R1)。但在多回合交互(Agentic)场景下,问题变得棘手:
- 错误级联:早期的一个微小动作失误会引发后续状态的偏移,导致信用分配(Credit Assignment)充满噪声。
- 裁剪失灵:传统的 PPO 或 GRPO 在 Token 级别进行重要性采样裁剪,这在长文本生成中无法限制整个序列的偏移。
- 格式坍塌:训练初期,模型极易因为无法生成正确的
<action>格式而陷入死循环,导致负反馈信号淹没有效学习。
方法论:分解策略梯度的四个维度
为了找出不稳定的真凶,作者将策略梯度(Policy Gradient)拆解为四个关键维度进行消融实验:
- Loss Aggregation (损失聚合):对比 Token-mean 与 Seq-mean。
- IS Clipping (重要性采样裁剪):这是最关键的发现。
- Advantage Design (优势设计):引入环境状态反馈辅助判断。
- Dynamic Sampling (动态采样):过滤无效轨迹。
图 1:ARLArena 的系统化分析框架,从分解到统一方案 SAMPO。
核心发现 1:序列级裁剪是救命稻草
作者惊讶地发现,像 SAPO 或 CISPO 这样在 Token 级别采用“宽容裁剪”的方法在 ARL 中极易瞬间崩溃。结论是:必须使用序列级裁剪(Sequence-level Clipping)。通过约束整个 Action 序列的偏移量,可以有效抑制 Off-policy 带来的副作用。
核心发现 2:负优势轨迹的毒害
实验通过离群值分析发现,训练崩溃通常是由具有负优势(Negative Advantage)且 IS 比例极低的样本驱动的。针对此类样本实施 Sequence Masking 能显著稳定模型。
终极方案:SAMPO 算法
结合所有洞察,作者提出了 SAMPO (Stable Agentic Multi-turn Policy Optimization)。
其中 是基于序列平均的 IS 比例,而 融合了全局奖励与局部步骤奖励。这种集成方案不仅解决了稳定性问题,还大大提升了学习速率。
图 2:在 ALFWorld 和 Sokoban 任务中,SAMPO(红线)表现出极佳的单调增长稳定性。
实验结果:开源 4B 逆袭闭源巨头
在 WebShop 和 ALFWorld 的严苛测试下,基于 Qwen-4B 的 SAMPO 模型展现了惊人的跨回合规划能力。
- 性能提升:相比 GRPO 基线,在多回合任务中平均提升 25.2%。
- 越级对标:令人震惊的是,4B 规模的小模型在特定 ARL 任务上的成功率竟然压倒了 GPT-5.2 和 Gemini 2.5 Pro。这说明:对环境的深度对齐(Alignment)和稳定的 RL 训练,其价值远超单纯的模型参数缩放。
图 3:各维度方法在多任务下的详尽对比。
深度总结:通往稳定 ARL 的三部曲
根据 ARLArena 的实践,构建一个稳定的智能体训练流水线应遵循:
- 干净的初始化:通过行为克隆(BC)确保模型处在一个合理的行为流形(Manifold)上。
- 强制格式约束:在奖励函数中加入严格的格式罚分(Format Penalty)。
- 序列全局管控:放弃局部 Token 裁剪,拥抱序列级优化。
ARLArena 的出现,标志着 LLM Agent 的后训练(Post-training)正从“摸黑探索”走向“工程标准化”。对于开发者而言,这篇论文提供的不仅是算法,更是一套成熟的可复现 Pipeline。
