[2026] SGE:突破 LLM 智能体边界,用“策略探索”取代“随机尝试”
Expanding LLM Agent Boundaries with Strategy-Guided Exploration
本文提出了 Strategy-Guided Exploration (SGE) 框架,旨在解决大语言模型(LLM)智能体在强化学习(RL)后训练中的探索难题。通过在动作执行前生成高层级自然语言策略,并在代码生成、UI 交互、工具调用及具身智能等任务中实现 SOTA 性能。
TL;DR
在强化学习训练 LLM 智能体时,最头疼的问题莫过于模型只会“复读”基座模型的能力,无法探索出更优解。Apple 研究团队提出的 Strategy-Guided Exploration (SGE) 给出了一种优雅的方案:让模型先写出“我要怎么做”的语言策略,再执行具体动作。通过对策略进行高温度采样和成败反思,SGE 成功让智能体学会了基座模型原本根本搞不定的难题。
背景定位:RL 训练的“天花板”效应
当前的 RL 后训练(如 GRPO)在数学推理上效果显著,但在智能体任务(如操控手机、写代码修复 Bug)中却常撞上天花板。原因在于这些环境的奖励极其稀疏:只有任务完全成功才有奖励。如果基座模型本身没有足够的概率撞大运成功一次,RL 就没有学习信号。传统的做法是加大采样温度,但这往往导致模型在乱点屏幕或写出语法错误的废话,而非有意义的尝试。
痛点深挖:动作空间的无效熵
作者发现,直接增加 Action 的熵通常是“低效噪声”。
- 低级探索的无力:在 UI 控制中,高温度采样可能只是让手指在同一个按钮的不同像素点上晃动。
- 语言策略的魔力:如果你告诉模型“尝试长按而不是单击”,这一个词的改变就能带动一系列完全不同的动作序列。

核心方法:SGE 的三驾马车
1. 策略提示 (Strategy Prompting)
SGE 要求模型在输出 Action 之前,必须先输出 Strategy。策略是对即将采取的一系列行动的高度概括。
2. 混合温度采样 (Mixed-Temperature Sampling)
这是 SGE 最具灵感的创新点。
- Strategy 部分:使用高温度(如 1.2),鼓励模型产生脑洞大开的方案。
- Action 部分:使用低温度(如 0.7),确保在选定方案后,执行细节(如代码语法、点击坐标)是稳健的。
这种解耦让探索变得“有目的且多样化”。
3. 策略反思 (Strategy Reflection)
SGE 建立了一个策略缓冲区。如果上次失败了,模型会收到提示:“这是之前的失败策略,请分析原因并尝试一个全新的不同路径。” 这种负向反思(Negative Reflection)极大地拓宽了模型的探索前沿。
实验战绩:突破基座能力的极限
研究团队在四个领域进行了严苛测试:
- Coding: 在 606 个难题上,即使基座模型尝试 2048 次都无法解决的题目,SGE 也能通过探索学会。
- AndroidWorld: 在手机 UI 操控上,SGE 展示了极强的泛化能力。

从曲线中可以看到,传统的 GRPO 或 EntropyAdv(熵优势)方法往往在基座模型的 Pass@k 线上方就停止增长了,而 SGE 是唯一一个能够持续向上突破、真正“学到新东西”的方法。
深度洞察:为何有效?
SGE 的本质是将离散、高维的动作搜索转化为了结构化的自然语言规划搜索。

如上图所示,在 Android 任务中,普通模型只会反复点击文件名。而 SGE 在高层策略的驱动下,会尝试点击文件后缀下拉框。正是这种“策略上的多样性”带来了“结果上的突破”。
总结与局限
SGE 证明了 LLM 内部的推理能力可以反哺自身的 RL 训练。它的局限性在于增加了推理开销(每一步都要多写一段策略),但在离线后训练阶段,这种成本相对于获取更高性能的智能体来说是完全可以接受的。
Takeaway: 想要智能体更聪明,不要只教它“怎么做”,要先让它学会“怎么想出不同的招数”。
