RAO:训练智能体学会“分治法”,突破上下文限界与推理性能天花板

Recursive Agent Optimization

总结
问题
方法
结果
要点
摘要

本文提出了递归智能体优化 (Recursive Agent Optimization, RAO),一种通过强化学习训练 LLM 智能体在推理时自主创建执行树并生成子智能体(sub-agents)的方法。该方法赋予智能体分治(Divide-and-conquer)能力,使其通过递归调用自身来解决超出上下文限制的复杂任务,并在多个基准测试上达到 SOTA 性能。

TL;DR

卡内基梅隆大学与亚马逊研究团队提出了 Recursive Agent Optimization (RAO)。与以往在推理时简单“外挂”递归脚本不同,RAO 通过强化学习让模型真正学会了何时委派子任务以及如何分治。实验证明,这种“原生递归”能力让智能体能以 8K 的窗口解决 40K 的问题,且在复杂任务上的成功率从 20% 飞跃至 88%。

1. 痛点:为什么“大力出奇迹”也有上限?

当前的 LLM 智能体在面对软件工程、深度调研等复杂长程任务时,通常会撞上两堵墙:

  • 上下文限界 (Context Limit):尽管窗口在变大,但极长文本下的注意力流失(Lost in the Middle)和 KV Cache 的 OOM 风险依然严重。
  • 规划崩溃:单智能体在应对长序列决策时,容易在中间步骤出错且缺乏有效的回溯和并行能力。

现有的递归框架(如 ADaPT)大多是基于 Prompt 定义的“脚手架”,模型本身并不理解为什么要分治。如果你不教模型如何当老板,它就永远只会像个迷茫的初级员工。

2. RAO 的核心秘籍:让模型学会“当老板”

RAO 的核心思想是端到端训练。它训练一个单一的策略 ,这个策略被同时应用在递归执行树的根节点和所有子节点上。

2.1 递归执行架构

智能体不再仅仅是输出文本,而是运行在一个增强的 Python REPL 环境中。它可以通过调用 launch_subagent 异步产生新的自我副本。 模型推理示例图 图 1:RAO 在深度调研任务中的动态执行树。父智能体决定任务拆分,子智能体在新鲜的上下文中独立寻找答案。

2.2 强化学习奖励设计

RAO 解决信度分配(Credit Assignment)的方案非常巧妙。它定义了一个局部节点奖励:

  • 自我成就感:当前任务是否完成。
  • 委派奖金:如果我派出去的“小弟”们成功了,我作为“老板”也能拿绩效奖励。 这种设计引导模型不仅要解决问题,还要学会精准招人有效下达指令

3. 实验战果:降维打击

3.1 突破 8K 上下文迷思

在合成任务 TextCraft-Synth 中,研究者故意将模型的训练窗口限制在 8K。结果显示,RAO 训练出的智能体通过将复杂合成任务拆解成 4-10 层的递归逻辑,成功率完爆了拥有 40K 窗口的单智能体模型。这证明了:优秀的拆解策略比昂贵的硬件显存更有效

3.2 效率与性能的双赢

在 Hard 难度的任务中,RAO 带来的性能提升是质变的(20% -> 88%)。 实验结果对比 图 2:在 Medium 和 Hard 任务下,递归智能体在成功率和墙钟速度上均占优。

值得注意的是,对于可以并行的任务,递归智能体的墙钟运行时间缩短了 2.5 倍。这意味着它学会了像真正的系统工程一样并发处理子模块。

4. 深度洞察:自动演化的课程学习

RAO 为什么有效?

  • 内在课程学习 (Implicit Curriculum):父任务太难时,模型生成的子任务通常更简单。这种从简单子任务到复杂父任务的梯度,促成了模型在训练中的快速收敛。
  • 信度分配精度:相比于直接给最后一个 Root Reward,RAO 提供的层级化密集奖励(Dense Rewards)让模型能清晰感知到是哪一步委派出了问题。

5. 局限性与未来展望

尽管 RAO 在研究和合成任务中表现优异,但它目前在处理纯顺序依赖(难以拆分并行)的任务时,由于增加了多次模型调用的 Overhead,其推理成本(Token 消耗)依然比单智能体高出不少。

未来,我们可能会看到异构递归:即一个强大的母模型(如 GPT-4 级别)利用 RAO 策略去调度大量的轻量级小模型(如 Qwen-4B)来完成长程计算,这或许是迈向“超大规模自动化智能体组织”的关键一步。

总结

RAO 告诉我们,智能体的强弱不仅仅取决于它读过多少书(参数量和窗口),更取决于它是否有组织复杂工作的智慧。学会委派,是智能体迈向进阶生产力的第一步。

发现相似论文

试试这些示例

  • 查找最近其他通过强化学习训练 LLM 智能体自主进行任务拆分与委派(Task Decomposition/Delegation)并实现推理侧规模扩展的论文。
  • 哪篇论文最早提出了“递归语言模型”(Recursive Language Models)或类似的 CodeAct-style 委派机制,RAO 在奖励建模上是如何改进它们的?
  • 有哪些研究将类似 RAO 的递归博弈或分治强化学习方法应用到了自动软件工程 (AISE) 或大规模多模态决策任务中?
目录
RAO:训练智能体学会“分治法”,突破上下文限界与推理性能天花板
1. TL;DR
2. 1. 痛点:为什么“大力出奇迹”也有上限?
3. 2. RAO 的核心秘籍:让模型学会“当老板”
3.1. 2.1 递归执行架构
3.2. 2.2 强化学习奖励设计
4. 3. 实验战果:降维打击
4.1. 3.1 突破 8K 上下文迷思
4.2. 3.2 效率与性能的双赢
5. 4. 深度洞察:自动演化的课程学习
6. 5. 局限性与未来展望
7. 总结