OpenClaw-RL:让 Agent 在交互中进化,通过“对话”完成模型训练

OpenClaw-RL: Train Any Agent Simply by Talking

2026-01-01
Yinjie Wang, Xuyang Chen, Xiaolong Jin, Mengdi Wang, Ling Yang
总结
问题
方法
结果
要点
摘要

本文提出了 OpenClaw-RL,一个支持在线学习的智能体(Agent)强化学习框架。该框架通过 server-client 架构从用户交互、终端反馈及 GUI 状态变化中提取“评估性”与“指令性”信号,实现了 Personal Agents(个人助理)和 General Agents(通用智能体)在统一架构下的持续进化。

TL;DR

传统的 LLM 训练往往停留在离线阶段,而 OpenClaw-RL 开启了“边用边学”的新范式。它通过捕捉用户反馈(如“不对,请先检查文件”)或环境状态变化,将其转化为强化学习的监督信号。通过创新的重叠引导 Hint 选择机制,它解决了在线学习中极易出现的训练崩溃问题。

核心背景:Agent 信号的“浪费”

当前的 Agent 系统中,每一次用户重查(Re-query)、每一次工具报错、每一次 GUI 的状态迁移,其实都隐含了对模型当前行为的评价。然而,现有的工作(如传统的 RLHF)通常需要收集成批的数据后离线训练。OpenClaw-RL 填补了这一空白:它把 Agent 部署后的每一条交互流变成了实时的训练源。

架构解析:四路异步的“Slime”基础设施

OpenClaw-RL 基于高性能的 slime 框架,其最大的特点在于完全解耦

  • Inference API: 负责推理,不阻塞用户需求。
  • Environment Server: 托管各种环境(终端、浏览器等)。
  • PRM / Judge: 异步评分并从下一状态中提取“Hint”。
  • Megatron-LM: 后台悄悄进行梯度更新。

模型架构图 图 1: OpenClaw-RL 基础设施概览。左侧为个人助理,右侧为云端并行环境。

算法灵魂:如何让在线学习不再“炸车”?

在线学习最怕 Teacher(带 Hint 的模型)与 Student(基础模型)认知差太大。如果 Teacher 给出的建议在 Student 看来是“天外来客”,梯度就会剧烈波动。

1. 混合 RL 目标 (Hybrid RL Objective)

作者提出将**评估信号(Evaluative)指令信号(Directive)**结合。

  • Evaluative: 每个动作都有分(对/错),类似传统的奖励模型。
  • Directive: 只有当下一状态包含修正信息时(如用户纠错),才生成 Token 级的 Hint。
  • 公式直觉:

2. 重叠引导的 Hint 选择 (Overlap-Guided Hint Selection)

这是本文最具学术深度的地方。系统会生成多个候选 Hint,计算 Teacher 的 Top-k 分布与 Student 分布的交集(Overlap)。选择那个“最能让 Student 听懂”的 Hint。这确保了在蒸馏过程中,重要性采样比率(Importance Ratio)接近 1。

Overlap引导机制 图 2: 通过最大化 Top-k Token 交集来选择最稳定的 Hint。

实验战绩:全场景 Agent 的大统一

OpenClaw-RL 是首个在单一系统中统一了**终端(Terminal)、图形界面(GUI)、软件工程(SWE)和工具调用(Tool-call)**四类 Agent 的开源框架。

关键结果对比

在针对 Student、TA 和 Teacher 三种不同人设的个性化实验中,OpenClaw-RL 的对齐效率显著高于单纯的记忆系统(Mem0)和技能进化方法(Cognee)。

实验结果对比 图 3: 在 ReTool 和 RLVR 任务中,Hybrid RL 的收敛精度均高于 Outcome-only 基线。

深度洞察与总结

OpenClaw-RL 的价值不仅在于刷榜,而在于它提供了一种闭环化 (Close-loop) 的 Agent 进化方案。

  • 优点: 极大地降低了数据获取成本。每一位使用 Agent 的用户都在无意识中充当了标注员。
  • 局限性: 文末也客观提到,如果用户恶意修正或给出对抗性指令,模型可能会“学坏”。如何过滤这些毒素是未来的关键。
  • 启示: 对产业界而言,这意味着未来我们可以为每个员工/用户训练一个专属的、能够随着交流深入越来越懂你的个性化 Agent。

学术定位:本工作属于 LLM 在线强化学习与 Agent 系统的交叉前沿,在 DeepSeek-R1 式的 GRPO 奖励机制基础上,引入了更细粒度的 Hint 蒸馏,是构建实时进化 Agent 的重要基石。

发现相似论文

试试这些示例

  • 查找其他利用 Next-state 信号进行 Large Language Model 在线强化学习或实时策略优化的研究论文。
  • 哪篇论文最早引入了 On-policy Distillation (OPD) 并在 LLM 领域应用,OpenClaw-RL 在分布匹配稳定性上做了哪些具体改进?
  • 有哪些研究将类似 OpenClaw-RL 的异步 RL 训练架构应用于多模态 GUI 操作或复杂软件工程 (SWE) 任务的自动化。
目录
OpenClaw-RL:让 Agent 在交互中进化,通过“对话”完成模型训练
1. TL;DR
2. 核心背景:Agent 信号的“浪费”
3. 架构解析:四路异步的“Slime”基础设施
4. 算法灵魂:如何让在线学习不再“炸车”?
4.1. 1. 混合 RL 目标 (Hybrid RL Objective)
4.2. 2. 重叠引导的 Hint 选择 (Overlap-Guided Hint Selection)
5. 实验战绩:全场景 Agent 的大统一
5.1. 关键结果对比
6. 深度洞察与总结