Agent Skills 综述:跨越“工具调用”到“专家执行”的质变
A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications
本文系统性地梳理了基于大语言模型(LLM)的智能体技能(Agent Skills)研究。文章提出了涵盖表征、获取、检索与选择、以及演化四个生命阶段的分类框架,旨在解决智能体在执行复杂任务时从零推理效率低、不可靠的痛点。
TL;DR
在 AI 智能体领域,能调用 API 并不代表能完成任务。本文深度解析了一篇关于 Agent Skills 的前沿综述,它定义了智能体的“肌肉记忆”——技能,并详细拆解了技能如何从零碎的交互轨迹中被获取、在海量库中被检索、以及在反馈中自动进化。
背景定位:为什么工具箱不等于战斗力?
在 LLM Agents 的主流框架中,我们习惯于给模型堆砌各种 Tools(搜索、计算器、API)。然而,现实痛点在于:
- 重复造轮子:每次任务模型都要从原始指令开始推理,由于 LLM 的不确定性,这种“冷启动”极易出错。
- 黑盒协调:多个 API 之间如何传递参数、失败了如何 fallback,目前大多依赖 Prompt 里的运气。
作者提出:智能体需要的是 Skills(技能) 而不仅仅是 Tools(工具)。工具是原子化的 API,而技能是封装了“Know-how”的可复用流程。

核心架构:技能的“生命周期”
论文将 Agent Skills 的研究版图划分为四个核心阶段,旨在打造一个闭环的技能生态。
1. 技能获取 (Skill Acquisition):从哪里来?
智能体不再仅仅依靠人类预定义的 SOP,而是通过四种路径“习得”本领:
- 经验衍生 (Experience-derived):通过回溯成功的执行轨迹(Trace),提取出逻辑模板。例如著名的 Voyager 框架。
- 任务衍生 (Task-derived):针对当前任务即时合成代码或脚本,验证通过后存入技能库。
- 语料衍生 (Corpus-derived):从开源代码仓库、API 文档中“学习”专家的处理模式。
2. 技能表征 (Skill Representation):长什么样?
一个标准的技能不再是一个 Prompt 模板,而是一个元组 :
- M (Main Document):人类可读的根指令(SOP)。
- R (Resources):关联的辅助资源,如可执行脚本、Prompt 示例、XML 架构等。
- C (Conditions):触发条件和适用范围,解决“什么时候该用它”的问题。

3. 检索与选择 (Retrieval & Selection):如何找到它?
当技能库达到万级规模(如 SkillNet 已有 30 万+技能),检索就成了瓶颈。
- 语义检索 vs 结构检索:不仅要看语义相关性,还要看技能的**前置条件(Preconditions)**是否满足当前环境。
- 组合决策:智能体需要判断是调用一个单一技能,还是组合(Composition)多个技能形成工作流。
4. 技能进化 (Skill Evolution):如何变强?
技能不是静态的。在执行失败后,智能体会进入一个类似“自我复盘”的过程:
- 修订 (Revision):基于报错日志修改技能代码。
- 验证 (Validation):通过单元测试后再将其同步回技能库,实现全系统的“集体智慧”升级。
实验与应用:技能驱动的红利
论文总结了技能框架在软件工程、医疗、金融等 8 大领域的应用。以软件工程为例,通过封装“Code-repair”技能,智能体能自动检查日志、定位 Bug、运行测试并修复,效率相比单次 Prompt 推理提升明显。

深度洞察:未来的挑战
作为资深主编,我认为本文指出的两个方向极具前瞻性:
- 资源漂移 (Resource Drift):当底层 API 更新时,如何自动让与之关联的数万个 Skills 不失效?
- 安全治理 (Governance):如果一个技能具有“毒性”或存在恶意的隐含逻辑(Poisoning),智能体在调用时可能引发灾难。
总结
Agent Skills 是智能体走向工业级部署的必经之路。它让 LLM 摆脱了“试错代价高昂”的窘境,通过外挂的程序化资产,赋予了智能体真正的“专家经验”。
欲了解更多有关该研究的资源,可访问:https://github.com/JayLZhou/Awesome-Agent-Skills
