[ICLR 2025] SkillCraft:LLM Agent 真的能像人类一样“学习技能”吗?
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?
本文提出了 SkillCraft,一个旨在评估 LLM Agent 发现、抽象并复用高阶工具组合(称为 Skills)能力的深度基准测试。该研究引入了 Skill Mode 协议,使 Agent 能够自动将原子级工具调用组合成可执行代码脚本并进行缓存,在长步长任务中实现 SOTA 级别的效率提升。
TL;DR
传统的 AI Agent 评测通常是“一次性”的:给它一堆 API,看它能不能解决当前问题。然而,真正的智能体应该具备**技能习得(Skill Acquisition)**能力。旷视、牛津、香港科大等机构的研究者联合发布了 SkillCraft,通过让 Agent 将重复的工具调用链封装成 Python 代码(Skills),实现了高达 80% 的 Token 节省,并揭示了顶级模型(如 GPT-5, Claude 4.5)在长程任务中的本质优势。
痛点深挖:为什么当前的 Agent “又慢又贵”?
在现实世界的复杂任务中(如分析 10 个 GitLab 仓库的活跃度),Agent 往往陷入一种低效循环:
- 冗余的状态传递:API A 的输出必须传回给 LLM,再由 LLM 处理后作为参数传给 API B。
- 上下文过载:动辄数十步的推理让上下文窗口迅速填满,导致 Agent 产生幻觉或遗忘目标。
- 缺乏经验积累:模型每次遇到相似子任务都要从头规划,无法像人类通过“熟能生巧”形成自动化反应。
核心机制:Skill Mode 与 MCP 原语
为了解决上述痛点,作者提出了 Skill Mode。这不仅仅是一个提示词工程,更是一套基于 MCP (Model Context Protocol) 的协议。
1. 四个核心武器 (Primitives)
save_skill: 将一段工具调用逻辑存为 Python 脚本。execute_skill: 传入参数,直接运行已有的脚本。list_skills&get_skill: 实现技能的检索与发现。
2. 闭环验证 (Coding Verifier)
不是所有的脚本都能入库。SkillCraft 引入了三层校验:语法检查 -> 运行时错误捕获 -> 输出质量检测。只有通过验证的“高质量技能”才会被存入持久化的 Skill Library。
图 1:SkillCraft 协议全景,展示了从任务探索到技能抽象,再到库存储与复用的完整闭合环路。
实验发现:强者恒强,技能亦有“阶级”
研究团队在包含 126 个具有重复逻辑的任务上测试了主流的闭源与开源模型。
效率的巨大飞跃
实验结果显示,通过技能复用,GPT-5.2 的 Token 使用量下降了 79%,成本降低了 75%。更有趣的是,这种效率提升与模型基础能力正相关(见下表)。
图 2:主流模型在 Baseline 与 Skill Mode 下的表现对比。红色部分显示虽然对话轮数(Turns)因验证步骤略有增加,但总 Token 数(Avg Tokens)剧烈下降。
深度洞察:深层嵌套是陷阱吗?
研究者尝试了层级化技能(Hierarchical Composition),即技能 A 调用技能 B。结论出人意料:虽然理论上更优雅,但由于误差累积效应(Error Propagation),深层嵌套往往导致成功率下降。目前阶段,扁平且经过充分测试的技能库比复杂的层级架构更可靠。
跨模型通用性:高能力模型的“馈赠”
这是一个非常重要的发现:由 Claude 4.5 生成的技能,交给 Gemini 或国产模型运行,依然表现优异且省钱。而弱模型生成的技能往往存在逻辑缺陷。这意味着在多 Agent 协作中,我们应该让“最聪明的脑子”去沉淀技能资产,供给整个系统复用。
总结与局限
SkillCraft 证明了技能抽象是 LLM Agent 通向高效长任务处理的必经之路。
- 核心价值:将长程推理转化为高效的程序执行。
- 局限性:目前高度依赖模型的 Coding 能力,对于非代码类任务的抽象尚不清晰。
- 启发:未来的 Agent 不应只追求“做对”,更应追求“学会做”。
本文作为学术技术解读,旨在探讨 Agent 架构的下一阶段。更多详情请参考 GitHub 开源仓库 github.com/shiqichen17/SkillCraft。
