[ICLR 2025] ICRL:无需 SFT,让强化学习开启大模型的“自主工具箱”

In-Context Reinforcement Learning for Tool Use in Large Language Models

总结
问题
方法
结果
要点
摘要

本文提出了 ICRL (In-Context Reinforcement Learning),一种无需监督微调 (SFT) 即可训练大语言模型 (LLM) 使用外部工具的强化学习框架。该方法通过在 RL 训练的采样阶段引入 Few-shot 示例提供软监督,并结合课程学习逐步减少示例,最终实现模型的自主工具调用,在多项推理基准上达到 SOTA。

TL;DR

传统的 LLM 工具使用训练往往需要昂贵的 SFT(监督微调)数据来“教会”模型基本的调用格式。本文提出的 ICRL (In-Context Reinforcement Learning) 彻底打破了这一范式。它通过在强化学习的 Rollout 采样阶段巧妙地植入 Few-shot 示例,利用课程学习(Curriculum Learning)实现从“临摹”到“自发使用”的平滑过渡,在完全不依赖人工标注轨迹的情况下,刷新了多项 QA 和数学竞赛基准的 SOTA。


1. 痛点:SFT 的沉重代价与 RL 的探索荒原

在 LLM 领域,赋予模型使用搜索、计算器或代码解释器的能力已成为刚需。然而,现状却很尴尬:

  1. SFT 依赖症:主流方法(如 DeepSeek-R1 的某些前序版本或 ReTool)需要先通过 SFT 让模型学会用 XML 标签或特定 JSON 格式调用工具。这些高质量的“思考-搜索-回答”轨迹非常难以合成和标注。
  2. RL 探索难:如果不做 SFT 直接让模型 RL,模型可能在成千上万次的尝试中都写对一个复杂的 <search> query </search> 标签,导致奖励永远为零,模型根本无从学习。

ICRL 的研究直觉非常直接:为什么不直接在 RL 采样的时候,给模型几个例子看看?


2. 核心机制:ICRL 的训练演进

ICRL 并没有修改模型底层的 RL 算法(基于 GRPO),其本质上的创新在于采样模板的动态演化

架构解析:从“带路”到“独行”

ICRL 将训练分为几个阶段,形成了一个从强监督到无监督的**课程学习(Curriculum Learning)**过程:

  • 3-shot 引导期:在采样 Prompt 里放 3 个完整的工具使用例子。模型此时是在例子的“暗示”下进行探索,极大地降低了格式错误的概率。
  • 2-shot 过渡期:减少例子权重,让模型开始尝试模仿例子但更多地依靠自身权重生成 query。
  • 0-shot 内化期:彻底移除例子。此时模型已经通过前两个阶段的 RL 梯度更新,将工具调用的逻辑和 XML 格式内化到了参数中。

ICRL 训练流程图 图 1:ICRL 工作流程。通过分阶段减少 In-context 示例,引导模型实现从模仿到自主工具调用的飞跃。

数学直觉:Loss Masking

在工具调用中,外部工具返回的 Observation(如搜索结果)是不应该参与梯度计算的,因为那不是模型生成的。ICRL 采用了 Loss Masking 技术,只对模型生成的 Action(搜索词)和 Thought(思考过程)计算策略梯度,确保学习过程的纯净。


3. 实验战绩:低成本下的高爆发

研究团队在 Qwen2.5 全系列上验证了 ICRL 的威力。

性能飞跃

在复杂的 Multi-hop QA 任务中,ICRL 展现了惊人的统治力。相比于同样旨在增强搜索能力的 Search-R1ZeroSearch,ICRL 在 Qwen2.5-3B 上的平均 Accuracy 提升了近 9 个百分点

实验结果对比 表 1:ICRL 与各类基线在复杂 QA 数据集上的性能对比。

数学竞技场:击败 SFT 王者

最令人惊讶的发现来自数学竞赛 AIME。专门为代码工具设计的 SFT+RL 框架 ReTool 在 AIME2024 上表现强劲,但在最新的 AIME2025 上,完全不吃 SFT 数据的 ICRL 反而取得了更高的准确率。这证明了 ICRL 捕捉到的工具使用倾向比死板的 SFT 数据更具泛化性。


4. 深度洞察:为什么 320 课程更好?

作者在消融实验中发现,课程的设计并非越细越好。例如,采用 3-2-0 的三阶跳效果远好于 3-2-1-0深度分析:过早地切入 1-shot 或极简 Prompt 会导致模型为了追求 RL 中的格式奖励而产生“过早停止”的倾向(即模型倾向于只搜索一次就草草回答),这会损害多轮推理的深度。

消融实验可视化 图 2:不同课程设计对模型多轮搜索深度及最终 EM 准确率的影响。


5. 总结与未来

ICRL 的成功标志着 Post-training 的范式转移:从“费力寻找好的示范数据(SFT)”转向“利用 Prompt 引导模型在 RL 中发现好的示范”。

优缺点简评

  • 优势:极高的极数据效率,省去了复杂的轨迹标注;在多轮推理中展现出极强的鲁棒性。
  • 局限:目前的实验主要集中在搜索和代码上,对于更复杂的长链条 Tool Learning(如操控 API 链)尚需进一步验证。

正如作者在结论中所述,ICRL 为构建具有长期推理能力的 Agent 提供了一个极其 Scalable 的路径。未来,或许我们不再需要昂贵的推理语料包,只需要给 LLM 几个例子,剩下的交给它自己在强化学习的深海中“悟道”。

发现相似论文

试试这些示例

  • 查找最近其他尝试在强化学习训练过程中动态调整 Prompt 长度或内容的“In-Context RL”相关论文。
  • 哪篇论文最早提出了 GRPO (Group Relative Policy Optimization) 算法,ICRL 是如何改进其损失函数以处理非训练的工具返回内容的?
  • 研究如何将 ICRL 框架扩展到除了搜索和代码执行之外的其他复杂多模态工具调用场景。
目录
[ICLR 2025] ICRL:无需 SFT,让强化学习开启大模型的“自主工具箱”
1. TL;DR
2. 1. 痛点:SFT 的沉重代价与 RL 的探索荒原
3. 2. 核心机制:ICRL 的训练演进
3.1. 架构解析:从“带路”到“独行”
3.2. 数学直觉:Loss Masking
4. 3. 实验战绩:低成本下的高爆发
4.1. 性能飞跃
4.2. 数学竞技场:击败 SFT 王者
5. 4. 深度洞察:为什么 3~2~0 课程更好?
6. 5. 总结与未来