[CVPR 2026 预选] GUI-Libra:突破原生 Agent 瓶颈,打造逻辑与操作双修的 GUI 导航大师
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
本文推出了 GUI-Libra,一个旨在增强原生 GUI Agent 长程导航与推理能力的训练框架。通过 action-aware 的监督微调(ASFT)和针对部分可验证环境优化的强化学习(RL),该模型在 AndroidWorld、WebArena 等多平台基准测试中显著超越了相似规模的模型,甚至可与 72B 级或闭源模型(如 GPT-4o)抗衡。
TL;DR
原生 GUI Agent 虽在“看图说话”上进步神速,但在“长程导航”上依然被闭源系统甩开。GUI-Libra 提供了一套完整的后训练菜谱:通过 Action-aware SFT 解决了推理与定位的冲突,利用 保守 RL 克服了 GUI 环境下奖励模糊的痛点。仅凭 4B/8B 的参数量,就在 AndroidWorld 和 WebArena 等测试中实现了对 SOTA 大模型的跨级反超。
背景定位:Agent 训练的“两难境地”
在构建 Native GUI Agent 时,研究者通常面临一个尴尬的折中:
- 要推理(CoT)还是要精度? 引入长链推理虽然帮模型理清了逻辑,但往往会分散模型对空间坐标坐标(Grounding)的注意力,导致“说得对、点不准”。
- 在线交互还是离线微调? 在线 RL 昂贵且环境脆弱;离线 RL 虽然安全,但面临“奖励歧义”——如果你点的不是 demo 里的那一个像素,即使用户意图达到了,模型也会被惩罚。
GUI-Libra 的出现,正是为了在离线数据的基础上,压榨出媲美在线学习的决策鲁棒性。
核心方法:两步走的精妙设计
1. Action-aware SFT:让模型“拎得清”
为了防止长篇大论的推理干扰坐标预测,作者设计了混合监督模式。
- 混合数据:同时训练“推理 动作”和“直接动作”两种样本。
- Token 重加权:在计算 Loss 时,给动作类型(Action)和坐标点(Grounding)分配更高的权重(),强制模型在思考的同时,绝不能在执行上掉链子。
图 1:GUI-Libra 的两阶段训练框架:SFT 阶段侧重对齐,RL 阶段侧重策略精炼
2. 保守 RL:在模糊中寻找最优解
在 GUI 环境中,动作序列往往是“条条大路通罗马”,但离线数据集只给了一条。如果模型跳出了 demo 的路径却完成了任务,传统的 RL 会将其视作失败。
- KL 正则化的物理直觉:通过极强的 KL 约束,防止模型在由于奖励模糊(Partial Verifiability)而导致的错误方向上“跑偏”。论文通过数学证明,KL 约束能控制在线分布与离线分布的偏移量(Occupancy Mismatch)。
- SNGS(成功自适应负梯度缩放):如果模型对某个动作很自信但没对上 demo,系统会降低这一负反馈的惩罚权重,防止过拟合于单一的操作习惯。
实验与结果:小模型的大能量
GUI-Libra 在 Android 和 Web 双战场都展现了统治力:
- AndroidWorld 战绩:GUI-Libra-8B 达到了 42.6% 的成功率,追平了 GPT-4o 的组合框架方案。
- WebArena 战绩:在仅使用极少量 Web 数据的情况下,仍反超了专门针对 Web 优化的 ScaleCUA-32B 模型。
图 2:不同响应长度下的定位精度对比。可见 ASFT 策略在超长推理下依然能保持极高的定位准确率
此外,消融实验揭示了一个有趣的现象:虽然在推理阶段加入思维链(CoT)会增加延迟,但对于在线环境的泛化至关重要。如果不让模型“想好了再点”,其在真实环境中的成功率会从 25.2% 断崖式跌落至 12.2%。
深度洞察:为什么 GUI-Libra 值得关注?
GUI-Libra 的成功揭示了后训练时代的三大真相:
- 数据过滤胜过数据量:通过对 170K 步数据进行一致性 re-prediction 和 BBox 验证,精简出的 81K 数据爆发了更强的战斗力。
- 离线预测在线并非不可能:通过 KL 正则化,作者成功建立了一套让离线指标(Offline Matching)高度预测在线表现(Online Success)的机制。
- Action-aligned Reasoning 是关键:Reasoning 不应该只是文字游戏,必须与最终的底层动作(Action)紧密耦合,否则推理就是 Agent 的“噪音”。
总结与未来
GUI-Libra 是一套非常务实的 Native GUI Agent 训练指南。它告诉我们,与其追求无限大的参数量,不如精细地处理好推理(Thought)与执行(Action)之间的分配比例,并利用数学手段约束 RL 的漂移。未来的研究方向将是如何将这一套逻辑扩展到全在线、实时交互的多模态学习中。
本文由资深学术技术主编重构。如需深入阅读原文,请访问项目主页:https://gui-libra.github.io
