[ICLR 2025] SkillCraft:LLM Agent 真的能像人类一样“学习技能”吗?

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

总结
问题
方法
结果
要点
摘要

本文提出了 SkillCraft,一个旨在评估 LLM Agent 发现、抽象并复用高阶工具组合(称为 Skills)能力的深度基准测试。该研究引入了 Skill Mode 协议,使 Agent 能够自动将原子级工具调用组合成可执行代码脚本并进行缓存,在长步长任务中实现 SOTA 级别的效率提升。

TL;DR

传统的 AI Agent 评测通常是“一次性”的:给它一堆 API,看它能不能解决当前问题。然而,真正的智能体应该具备**技能习得(Skill Acquisition)**能力。旷视、牛津、香港科大等机构的研究者联合发布了 SkillCraft,通过让 Agent 将重复的工具调用链封装成 Python 代码(Skills),实现了高达 80% 的 Token 节省,并揭示了顶级模型(如 GPT-5, Claude 4.5)在长程任务中的本质优势。

痛点深挖:为什么当前的 Agent “又慢又贵”?

在现实世界的复杂任务中(如分析 10 个 GitLab 仓库的活跃度),Agent 往往陷入一种低效循环

  1. 冗余的状态传递:API A 的输出必须传回给 LLM,再由 LLM 处理后作为参数传给 API B。
  2. 上下文过载:动辄数十步的推理让上下文窗口迅速填满,导致 Agent 产生幻觉或遗忘目标。
  3. 缺乏经验积累:模型每次遇到相似子任务都要从头规划,无法像人类通过“熟能生巧”形成自动化反应。

核心机制:Skill Mode 与 MCP 原语

为了解决上述痛点,作者提出了 Skill Mode。这不仅仅是一个提示词工程,更是一套基于 MCP (Model Context Protocol) 的协议。

1. 四个核心武器 (Primitives)

  • save_skill: 将一段工具调用逻辑存为 Python 脚本。
  • execute_skill: 传入参数,直接运行已有的脚本。
  • list_skills & get_skill: 实现技能的检索与发现。

2. 闭环验证 (Coding Verifier)

不是所有的脚本都能入库。SkillCraft 引入了三层校验:语法检查 -> 运行时错误捕获 -> 输出质量检测。只有通过验证的“高质量技能”才会被存入持久化的 Skill Library。

SkillCraft 协议流程图 图 1:SkillCraft 协议全景,展示了从任务探索到技能抽象,再到库存储与复用的完整闭合环路。

实验发现:强者恒强,技能亦有“阶级”

研究团队在包含 126 个具有重复逻辑的任务上测试了主流的闭源与开源模型。

效率的巨大飞跃

实验结果显示,通过技能复用,GPT-5.2 的 Token 使用量下降了 79%,成本降低了 75%。更有趣的是,这种效率提升与模型基础能力正相关(见下表)。

实验结果对比表 图 2:主流模型在 Baseline 与 Skill Mode 下的表现对比。红色部分显示虽然对话轮数(Turns)因验证步骤略有增加,但总 Token 数(Avg Tokens)剧烈下降。

深度洞察:深层嵌套是陷阱吗?

研究者尝试了层级化技能(Hierarchical Composition),即技能 A 调用技能 B。结论出人意料:虽然理论上更优雅,但由于误差累积效应(Error Propagation),深层嵌套往往导致成功率下降。目前阶段,扁平且经过充分测试的技能库比复杂的层级架构更可靠。

跨模型通用性:高能力模型的“馈赠”

这是一个非常重要的发现:由 Claude 4.5 生成的技能,交给 Gemini 或国产模型运行,依然表现优异且省钱。而弱模型生成的技能往往存在逻辑缺陷。这意味着在多 Agent 协作中,我们应该让“最聪明的脑子”去沉淀技能资产,供给整个系统复用。

总结与局限

SkillCraft 证明了技能抽象是 LLM Agent 通向高效长任务处理的必经之路。

  • 核心价值:将长程推理转化为高效的程序执行。
  • 局限性:目前高度依赖模型的 Coding 能力,对于非代码类任务的抽象尚不清晰。
  • 启发:未来的 Agent 不应只追求“做对”,更应追求“学会做”。

本文作为学术技术解读,旨在探讨 Agent 架构的下一阶段。更多详情请参考 GitHub 开源仓库 github.com/shiqichen17/SkillCraft

发现相似论文

试试这些示例

  • 查找最近关于大语言模型 Agent 自动发现和学习可重用程序化技能(Programmatic Skills)的论文。
  • 哪篇研究最早提出了基于代码行为(Code Action)的 Agent 决策框架,SkillCraft 如何在其基础上改进了持久化存储机制?
  • 有哪些最新的研究在探讨多 Agent 系统中跨模型共享工具调用技能(Skill Sharing)的协议与安全性?
目录
[ICLR 2025] SkillCraft:LLM Agent 真的能像人类一样“学习技能”吗?
1. TL;DR
2. 痛点深挖:为什么当前的 Agent “又慢又贵”?
3. 核心机制:Skill Mode 与 MCP 原语
3.1. 1. 四个核心武器 (Primitives)
3.2. 2. 闭环验证 (Coding Verifier)
4. 实验发现:强者恒强,技能亦有“阶级”
4.1. 效率的巨大飞跃
4.2. 深度洞察:深层嵌套是陷阱吗?
5. 跨模型通用性:高能力模型的“馈赠”
6. 总结与局限