[综述] Agent 工程的新范式:从“更强的模型”走向“更好的外部化装具”
Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering
本文提出了“外部化”(Externalization)作为大语言模型(LLM)Agent 设计的核心演进逻辑,并系统性地综述了该领域的最新进展。文章定义了一个统一的框架,将 Agent 的能力从单纯的模型权重(Weights)迁移到上下文(Context),最终整合进由记忆(Memory)、技能(Skills)、协议(Protocols)和装具工程(Harness Engineering)组成的外部基础设施层。
TL;DR
在 Agent 开发的赛道上,人们正逐渐发现:仅仅依靠调优模型权重(Weights)或堆砌上下文(Context)已经触及天花板。由上海交通大学、卡内基梅隆大学及 OPPO 等机构联合发表的这篇综述,提出了一个震撼行业的观点——**外部化(Externalization)**才是通往可靠智能体的必经之路。通过将记忆、技能和协议从模型内部剥离到外部的“装具”(Harness)中,我们正在经历一场从“炼丹”到“系统工程”的范式转移。
这种演进的本质逻辑是什么?
作者指出,人类文明的进步本质上就是一部“认知外部化”的历史:语言外部化了思想,文字外部化了记忆,而现在的 LLM Agent 正在通过 Harness Engineering 外部化原本属于神经网络的负担。
当一个 Agent 被要求在一个大型代码库中修复 Bug 时:
- 无外部化:模型必须在脆弱的 Prompt 中死记硬背整个项目的结构,极易产生幻想(Hallucination)。
- 外部化:持久化记忆提供背景,预定义的技能库(Skills)指引流程,标准协议(Protocols)确保工具调用的精确性。
图 1:从权重到上下文,再到装具(Harness)的力量重心转移。
核心三支柱:记忆、技能、协议
1. 记忆(Memory):状态的时间外部化
记忆不再仅仅是搜索 RAG 数据库。在装具架构下,记忆分为四个层级:
- 工作环境(Working Context):实时的任务快照。
- 情节合集(Episodic Experience):过去失败或成功的教训。
- 语义知识(Semantic Knowledge):抽象的业务逻辑。
- 个性化记忆(Personalized Memory):用户的偏好习惯。 这种结构将“回想”(Recall)转化为了“识别”(Recognition),大幅降低了模型的幻觉率。
2. 技能(Skills):专业知识的程序化
技能是外部化的“专家手册”。它不仅是工具(Tools),更是程序化的经验包。它包含操作规程、启发式策略和约束条件。通过将复杂的 Workflow 外部化为可发现、可加载的 SKILL.md,Agent 实现了从“临场即兴发挥”到“按流程执行”的转变。
3. 协议(Protocols):交互的结构化
协议解决了 Agent 与外部世界(工具、用户、其他 Agent)的通信噪音。如 Anthropic 的 MCP 或 Google 的 A2A 协议,它们为交互建立了确定的语法和语义边界。协议让 Agent 之间的协作像微服务架构一样清晰可靠。
图 2:以装具(Harness)为中心的外部化架构设计。
装具工程(Harness Engineering):Agent 的大脑环境
“装具”是这篇论文最核心的工程贡献。它不仅是一个外壳,而是 Agent 的认知环境。它管理着:
- 控制流(Control Flow):防止无限递归循环。
- 沙箱隔离(Sandboxing):确保执行代码不会格式化你的硬盘。
- 可观测性(Observability):每一阶段的推理过程都清晰可查。
- 人类介入计划(Human-in-the-loop):在关键决策点设立审批闸机。
深度洞察:为什么这会改变未来的 Agent 开发?
过去我们评估一个 Agent 的好坏,看的是它的基础模型(如 GPT-4 vs Claude 3.5)。但这篇论文告诉我们:一个拥有优秀装具中等模型,其可靠性往往优于一个处于裸跑状态(Unaided)的顶尖模型。
局限性与挑战
尽管外部化带来了可靠性,但也引入了新的开销。组件过多会导致认知过载——模型可能忙于解析复杂的 API 协议而忘记了最终目标。此外,外部文件的安全注入风险(如通过 Skill 文件的 Prompt Injection)也是未来必须攻克的难题。
总结
Agent 的发展已经从关注“模型参数”转向了关注“环境构建”。通过将记忆、技能和协议外部化,我们为 LLM 打造了一套坚固的铠甲。未来的理想 Agent 应该是:内核冷静(Parametric Reasoning),外壳强悍(External Infrastructure)。
一句话 Takeaway:别再纠结怎么写更好的 Prompt 了,去为你的 Agent 构建一套标准化的外部化装具(Harness)吧。
