[ICLR 2025] ICRL:无需 SFT,让强化学习开启大模型的“自主工具箱”
In-Context Reinforcement Learning for Tool Use in Large Language Models
本文提出了 ICRL (In-Context Reinforcement Learning),一种无需监督微调 (SFT) 即可训练大语言模型 (LLM) 使用外部工具的强化学习框架。该方法通过在 RL 训练的采样阶段引入 Few-shot 示例提供软监督,并结合课程学习逐步减少示例,最终实现模型的自主工具调用,在多项推理基准上达到 SOTA。
TL;DR
传统的 LLM 工具使用训练往往需要昂贵的 SFT(监督微调)数据来“教会”模型基本的调用格式。本文提出的 ICRL (In-Context Reinforcement Learning) 彻底打破了这一范式。它通过在强化学习的 Rollout 采样阶段巧妙地植入 Few-shot 示例,利用课程学习(Curriculum Learning)实现从“临摹”到“自发使用”的平滑过渡,在完全不依赖人工标注轨迹的情况下,刷新了多项 QA 和数学竞赛基准的 SOTA。
1. 痛点:SFT 的沉重代价与 RL 的探索荒原
在 LLM 领域,赋予模型使用搜索、计算器或代码解释器的能力已成为刚需。然而,现状却很尴尬:
- SFT 依赖症:主流方法(如 DeepSeek-R1 的某些前序版本或 ReTool)需要先通过 SFT 让模型学会用 XML 标签或特定 JSON 格式调用工具。这些高质量的“思考-搜索-回答”轨迹非常难以合成和标注。
- RL 探索难:如果不做 SFT 直接让模型 RL,模型可能在成千上万次的尝试中都写对一个复杂的
<search> query </search>标签,导致奖励永远为零,模型根本无从学习。
ICRL 的研究直觉非常直接:为什么不直接在 RL 采样的时候,给模型几个例子看看?
2. 核心机制:ICRL 的训练演进
ICRL 并没有修改模型底层的 RL 算法(基于 GRPO),其本质上的创新在于采样模板的动态演化。
架构解析:从“带路”到“独行”
ICRL 将训练分为几个阶段,形成了一个从强监督到无监督的**课程学习(Curriculum Learning)**过程:
- 3-shot 引导期:在采样 Prompt 里放 3 个完整的工具使用例子。模型此时是在例子的“暗示”下进行探索,极大地降低了格式错误的概率。
- 2-shot 过渡期:减少例子权重,让模型开始尝试模仿例子但更多地依靠自身权重生成 query。
- 0-shot 内化期:彻底移除例子。此时模型已经通过前两个阶段的 RL 梯度更新,将工具调用的逻辑和 XML 格式内化到了参数中。
图 1:ICRL 工作流程。通过分阶段减少 In-context 示例,引导模型实现从模仿到自主工具调用的飞跃。
数学直觉:Loss Masking
在工具调用中,外部工具返回的 Observation(如搜索结果)是不应该参与梯度计算的,因为那不是模型生成的。ICRL 采用了 Loss Masking 技术,只对模型生成的 Action(搜索词)和 Thought(思考过程)计算策略梯度,确保学习过程的纯净。
3. 实验战绩:低成本下的高爆发
研究团队在 Qwen2.5 全系列上验证了 ICRL 的威力。
性能飞跃
在复杂的 Multi-hop QA 任务中,ICRL 展现了惊人的统治力。相比于同样旨在增强搜索能力的 Search-R1 或 ZeroSearch,ICRL 在 Qwen2.5-3B 上的平均 Accuracy 提升了近 9 个百分点。
表 1:ICRL 与各类基线在复杂 QA 数据集上的性能对比。
数学竞技场:击败 SFT 王者
最令人惊讶的发现来自数学竞赛 AIME。专门为代码工具设计的 SFT+RL 框架 ReTool 在 AIME2024 上表现强劲,但在最新的 AIME2025 上,完全不吃 SFT 数据的 ICRL 反而取得了更高的准确率。这证明了 ICRL 捕捉到的工具使用倾向比死板的 SFT 数据更具泛化性。
4. 深度洞察:为什么 320 课程更好?
作者在消融实验中发现,课程的设计并非越细越好。例如,采用 3-2-0 的三阶跳效果远好于 3-2-1-0。
深度分析:过早地切入 1-shot 或极简 Prompt 会导致模型为了追求 RL 中的格式奖励而产生“过早停止”的倾向(即模型倾向于只搜索一次就草草回答),这会损害多轮推理的深度。
图 2:不同课程设计对模型多轮搜索深度及最终 EM 准确率的影响。
5. 总结与未来
ICRL 的成功标志着 Post-training 的范式转移:从“费力寻找好的示范数据(SFT)”转向“利用 Prompt 引导模型在 RL 中发现好的示范”。
优缺点简评:
- 优势:极高的极数据效率,省去了复杂的轨迹标注;在多轮推理中展现出极强的鲁棒性。
- 局限:目前的实验主要集中在搜索和代码上,对于更复杂的长链条 Tool Learning(如操控 API 链)尚需进一步验证。
正如作者在结论中所述,ICRL 为构建具有长期推理能力的 Agent 提供了一个极其 Scalable 的路径。未来,或许我们不再需要昂贵的推理语料包,只需要给 LLM 几个例子,剩下的交给它自己在强化学习的深海中“悟道”。
