[ICLR 2025] HGPO: 破解长程智能体训练中的“上下文不一致”难题
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
本文提出了名为 HGPO 的层次化组策略优化算法,旨在解决 LLM 智能体在长程任务(Long-horizon tasks)中面临的历史上下文不一致问题。HGPO 通过构建基于上下文相似性的层次化组结构并应用自适应权重聚合优势估计,在 ALFWorld 和 WebShop 任务中超越了 GRPO 和 GiGPO 等 SOTA 方法。
TL;DR
在长程智能体任务(如自动化网页购物、复杂环境导航)中,如何精准评估每一步动作的“好坏”是强化学习的核心。来自南洋理工大学等机构的研究者发现,现有方法在估计优势(Advantage)时忽略了历史上下文的差异,导致评估标准“张冠李戴”。为此,他们提出了 HGPO (Hierarchy-of-Groups Policy Optimization),通过一套优雅的层次化分组与权重聚合机制,显著提升了 LLM 智能体的决策精度。
背景定位
目前,LLM 智能体的训练正从单轮对话向多轮交互演进。传统的 Trajectory-wise 模型(整条路径优化)面临 Context 爆炸问题;而新兴的 Stepwise 模型(逐步优化)虽然高效,却在 Group-based RL(如 DeepSeek 提出的 GRPO)框架下暴露了致命弱点:历史上下文不一致 (Context Inconsistency)。
痛点深挖:消失的公平性
想象一下,两个智能体都处于“打开冰箱”这一状态。智能体 A 的历史是“寻找食物”,而智能体 B 的历史是“清理冰箱”。如果我们将它们的奖励放在一起进行平均(Group-based 的逻辑),并以此计算相对优势,这显然是不公平的。
作者通过实证研究发现:
- 轨迹级估计 (Trajectory-level):偏差极大。
- 步骤级估计 (Step-level):虽然细化了,但由于忽略历史,依然存在偏差。
- 理想情况 (Oracle):即历史完全一致。虽然最为精准,但在实际采样中极其稀疏,直接导致训练方差(Variance)激增,模型难以收敛。

核心方法:层次化组策略优化 (HGPO)
为了在“低偏差”和“低方差”之间寻找平衡点,HGPO 引入了两个关键设计:
1. 上下文感知层次分组 (Context-aware Hierarchical Grouping)
HGPO 并不是简单地寻找完全一致的历史,而是定义了一个 -step 的上下文算子。对于每一个步骤,它会归属于多个重叠的组:
- :仅要求当前状态一致。
- :要求过去 步的状态序列完全一致。 这种嵌套结构()确保了模型既能参考大量相似样本,又能聚焦于极其精确的同构样本。
2. 自适应权重优势估计 (Adaptive Weighting)
既然有了多层优势估计,如何合并?HGPO 采用了一种基于深度的启发式权重: 其中,历史一致性越长的组( 越大),赋予的权重越高。这意味着算法优先信任那些在相同背景下产生的对比结果。

实验结果与分析
研究团队在 ALFWorld(具身智能助手)和 WebShop(网络购物导航)两个重度依赖长程规划的基准上进行了测试。
- 各维度碾压:无论是在 Qwen2.5-1.5B 还是 7B 模型上,HGPO 均显著优于 PPO、GRPO 和 GiGPO。
- 泛化能力:在 Out-of-Distribution (OOD) 任务上,HGPO 展示了更强的鲁棒性,证明了精确的优势估计有助于智能体学习到真正的逻辑,而非过拟合于特定的上下文偏差。
- 效率高效:令人惊喜的是,HGPO 几乎没有增加训练时间。其核心操作完全在离线阶段通过哈希表查找完成,相比传统的 Critic 网络(PPO),显存占用和计算开销极低。

深度洞察
HGPO 的成功本质上是对 Bias-Variance Trade-off 的一次精妙演练。通过数学证明(Proposition 4.1),作者指出 HGPO 的优势估计值插值于“高偏差-低方差”的 Step-level 和“零偏差-高方差”的 Oracle 之间。
值得注意的是,这种方法在小模型(1.5B)上的提升尤为巨大。这暗示了模型能力越弱,越容易在冗余的步骤中迷失,此时精确的“同类项合并”对修正错误轨迹至关重要。
总结与展望
HGPO 为 LLM 智能体的分布式强化学习提供了一个极其务实的改进方案。它不需要额外的 Critic 模型,不需要重复的采样消耗,仅通过对数据的重新理解和分组,就撬动了性能的飞跃。未来的研究方向可能涉及如何处理经过压缩或摘要后的记忆(Memory)分组,这对于拥有无限长记忆的超级智能体将是下一个挑战。
