CoEvolve:打破静态数据桎梏,让 LLM Agent 在自我博弈中进化

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

总结
问题
方法
结果
要点
摘要

本文提出了 CoEvolve,一个 LLM Agent 与训练数据“双向演化”的强化学习框架。该方法通过从训练轨迹中提取遗忘、边界和稀缺信号来识别 Agent 的薄弱环节,并据此动态合成新任务进行针对性训练,在 AppWorld 和 BFCL 榜单上显著提升了开源模型(如 Qwen2.5/Qwen3)的性能。

TL;DR

阿里巴巴 AMAP 团队提出的 CoEvolve 框架,通过一种“智能体与数据双向演化”的思路,解决了 LLM Agent 训练中数据分布滞后的难题。它不再喂食固定的语料,而是通过监测模型的遗忘、犹豫和认知盲区,动态“定制”高难度的合成任务。实验证明,这一机制能让 4B 规模的小模型在工具调用能力上逆袭 GPT-4。

背景定位:从“喂养”到“演化”

在强化学习(RL)训练 LLM Agent 的过程中,我们通常面临两个极端:

  1. 人工示范 (Expert-Supervised):质量高但极度昂贵,像是一本读不完的字典,涵盖不了现实世界的无穷变数。
  2. 静态合成 (Static Synthetic):用 LLM 盲目生成数据,看似量大,实则大量重复,且与 Agent 当前的学习进度脱节。

CoEvolve 提出:数据不应该是死的,它应该像 Agent 的“教练”一样,模型哪里强,教练就换个花样考哪里。

核心机制:捕捉 Agent 的“焦虑”信号

CoEvolve 的精妙之处在于它定义了三种捕捉模型弱点的反馈信号 (Feedback Signals)

  • 遗忘信号 (Forgetting Signals):模型曾经能做对、但现在由于权重更新反而做错的任务。这预示着灾难性遗忘的苗头。
  • 边界信号 (Boundary Signals):模型在面对同一个任务时,多次尝试表现极其不稳定(时好时坏)。这说明该任务处于模型的“决策边界”。
  • 稀缺信号 (Rare Signals):在训练中极少出现的操作模式。这代表了模型未曾谋面的“长尾分布”。

架构拆解:闭环进化的三大阶段

模型架构图

1. 信号驱动的再探索 (Signal-Guided Re-exploration)

一旦在训练过程中识别出上述信号,系统会调用专门的“探索 LLM”对该轨迹进行复盘。它不只是简单的复试,而是基于失败原因生成“探索导引”,指导模型去尝试不同的参数组合或边缘条件。

2. 任务抽象与验证 (Abstraction & Validation)

探索出的原始交互非常杂乱。CoEvolve 会将其通过 LLM 抽象为清晰的“任务描述-解决方案”对,并必须通过真实的环境执行验证(例如真正的 API 调用)。只有执行成功的轨迹,才能被加入“进化训练集”中。

3. 指令微调与策略优化

使用 GRPO (Group Relative Policy Optimization) 算法进行迭代。由于训练数据始终围绕着模型的弱点在更新,梯度的指向性极强,有效避免了在已知领域的重复训练。

实验战绩:小模型的大反扑

实验结果对比

在主流的 Agent 评测集 AppWorld 和 BFCL 上,CoEvolve 展现了惊人的增长曲线:

  • 规模溢价:Qwen3-4B 在加入 CoEvolve 训练后,其 function-calling 综合表现不仅超越了多款 70B 开源模型,甚至击败了 GPT-4。
  • 稳定性验证:消融实验显示,即便只增加 10% 的额外计算开销,带来的性能增益也远超单纯增加训练步数。

深度洞察:为什么这种做法能行?

传统的 RL 往往陷入局部最优,或者由于数据分布偏移而导致性能崩塌。CoEvolve 实际上是一种自动化的课程学习 (Curriculum Learning)。通过“遗忘信号”查漏补缺,通过“边界信号”细化认知,通过“稀缺信号”开拓眼界。

更重大的意义在于:它降低了对人类专家数据的依赖。在未来,我们可以通过一个极其轻量的模型,在不断自我博弈和环境交互中,通过 CoEvolve 架构“进化”出具备极强鲁棒性的行业专家。

局限性与未来

尽管表现卓越,论文也指出:在训练初期模型极度不成熟时,产生的反馈信号可能存在大量噪声。未来的方向在于引入更稳健的安全过滤器以及跨领域迁移能力,防止 Agent 在自我进化的过程中“走火入魔”(偏离安全或业务逻辑边界)。


总结:CoEvolve 证明了 Agent 的智能不仅在于参数规模,更在于它与环境、与数据交互的深度和反馈闭环的质量

发现相似论文

试试这些示例

  • 查找最近其他利用模型反馈信号(如训练动态、遗忘统计)来动态调整合成数据分布或进行课程学习的论文。
  • 哪篇论文最早在深度学习中提出了“遗忘信号 (Forgetting Signals)”的概念,CoEvolve 是如何将其适配到 Agent 交互轨迹的?
  • 有哪些研究探讨了将这种 Agent-Data 互演化架构应用到需要长期记忆或多模态物理交互(如机器人操作)的任务中?
目录
CoEvolve:打破静态数据桎梏,让 LLM Agent 在自我博弈中进化
1. TL;DR
2. 背景定位:从“喂养”到“演化”
3. 核心机制:捕捉 Agent 的“焦虑”信号
4. 架构拆解:闭环进化的三大阶段
4.1. 1. 信号驱动的再探索 (Signal-Guided Re-exploration)
4.2. 2. 任务抽象与验证 (Abstraction & Validation)
4.3. 3. 指令微调与策略优化
5. 实验战绩:小模型的大反扑
6. 深度洞察:为什么这种做法能行?
7. 局限性与未来