RAO:训练智能体学会“分治法”,突破上下文限界与推理性能天花板
Recursive Agent Optimization
本文提出了递归智能体优化 (Recursive Agent Optimization, RAO),一种通过强化学习训练 LLM 智能体在推理时自主创建执行树并生成子智能体(sub-agents)的方法。该方法赋予智能体分治(Divide-and-conquer)能力,使其通过递归调用自身来解决超出上下文限制的复杂任务,并在多个基准测试上达到 SOTA 性能。
TL;DR
卡内基梅隆大学与亚马逊研究团队提出了 Recursive Agent Optimization (RAO)。与以往在推理时简单“外挂”递归脚本不同,RAO 通过强化学习让模型真正学会了何时委派子任务以及如何分治。实验证明,这种“原生递归”能力让智能体能以 8K 的窗口解决 40K 的问题,且在复杂任务上的成功率从 20% 飞跃至 88%。
1. 痛点:为什么“大力出奇迹”也有上限?
当前的 LLM 智能体在面对软件工程、深度调研等复杂长程任务时,通常会撞上两堵墙:
- 上下文限界 (Context Limit):尽管窗口在变大,但极长文本下的注意力流失(Lost in the Middle)和 KV Cache 的 OOM 风险依然严重。
- 规划崩溃:单智能体在应对长序列决策时,容易在中间步骤出错且缺乏有效的回溯和并行能力。
现有的递归框架(如 ADaPT)大多是基于 Prompt 定义的“脚手架”,模型本身并不理解为什么要分治。如果你不教模型如何当老板,它就永远只会像个迷茫的初级员工。
2. RAO 的核心秘籍:让模型学会“当老板”
RAO 的核心思想是端到端训练。它训练一个单一的策略 ,这个策略被同时应用在递归执行树的根节点和所有子节点上。
2.1 递归执行架构
智能体不再仅仅是输出文本,而是运行在一个增强的 Python REPL 环境中。它可以通过调用 launch_subagent 异步产生新的自我副本。
图 1:RAO 在深度调研任务中的动态执行树。父智能体决定任务拆分,子智能体在新鲜的上下文中独立寻找答案。
2.2 强化学习奖励设计
RAO 解决信度分配(Credit Assignment)的方案非常巧妙。它定义了一个局部节点奖励:
- 自我成就感:当前任务是否完成。
- 委派奖金:如果我派出去的“小弟”们成功了,我作为“老板”也能拿绩效奖励。 这种设计引导模型不仅要解决问题,还要学会精准招人和有效下达指令。
3. 实验战果:降维打击
3.1 突破 8K 上下文迷思
在合成任务 TextCraft-Synth 中,研究者故意将模型的训练窗口限制在 8K。结果显示,RAO 训练出的智能体通过将复杂合成任务拆解成 4-10 层的递归逻辑,成功率完爆了拥有 40K 窗口的单智能体模型。这证明了:优秀的拆解策略比昂贵的硬件显存更有效。
3.2 效率与性能的双赢
在 Hard 难度的任务中,RAO 带来的性能提升是质变的(20% -> 88%)。
图 2:在 Medium 和 Hard 任务下,递归智能体在成功率和墙钟速度上均占优。
值得注意的是,对于可以并行的任务,递归智能体的墙钟运行时间缩短了 2.5 倍。这意味着它学会了像真正的系统工程一样并发处理子模块。
4. 深度洞察:自动演化的课程学习
RAO 为什么有效?
- 内在课程学习 (Implicit Curriculum):父任务太难时,模型生成的子任务通常更简单。这种从简单子任务到复杂父任务的梯度,促成了模型在训练中的快速收敛。
- 信度分配精度:相比于直接给最后一个 Root Reward,RAO 提供的层级化密集奖励(Dense Rewards)让模型能清晰感知到是哪一步委派出了问题。
5. 局限性与未来展望
尽管 RAO 在研究和合成任务中表现优异,但它目前在处理纯顺序依赖(难以拆分并行)的任务时,由于增加了多次模型调用的 Overhead,其推理成本(Token 消耗)依然比单智能体高出不少。
未来,我们可能会看到异构递归:即一个强大的母模型(如 GPT-4 级别)利用 RAO 策略去调度大量的轻量级小模型(如 Qwen-4B)来完成长程计算,这或许是迈向“超大规模自动化智能体组织”的关键一步。
总结
RAO 告诉我们,智能体的强弱不仅仅取决于它读过多少书(参数量和窗口),更取决于它是否有组织复杂工作的智慧。学会委派,是智能体迈向进阶生产力的第一步。
