[综述] Agent 工程的新范式:从“更强的模型”走向“更好的外部化装具”

Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering

总结
问题
方法
结果
要点
摘要

本文提出了“外部化”(Externalization)作为大语言模型(LLM)Agent 设计的核心演进逻辑,并系统性地综述了该领域的最新进展。文章定义了一个统一的框架,将 Agent 的能力从单纯的模型权重(Weights)迁移到上下文(Context),最终整合进由记忆(Memory)、技能(Skills)、协议(Protocols)和装具工程(Harness Engineering)组成的外部基础设施层。

TL;DR

在 Agent 开发的赛道上,人们正逐渐发现:仅仅依靠调优模型权重(Weights)或堆砌上下文(Context)已经触及天花板。由上海交通大学、卡内基梅隆大学及 OPPO 等机构联合发表的这篇综述,提出了一个震撼行业的观点——**外部化(Externalization)**才是通往可靠智能体的必经之路。通过将记忆、技能和协议从模型内部剥离到外部的“装具”(Harness)中,我们正在经历一场从“炼丹”到“系统工程”的范式转移。

这种演进的本质逻辑是什么?

作者指出,人类文明的进步本质上就是一部“认知外部化”的历史:语言外部化了思想,文字外部化了记忆,而现在的 LLM Agent 正在通过 Harness Engineering 外部化原本属于神经网络的负担。

当一个 Agent 被要求在一个大型代码库中修复 Bug 时:

  • 无外部化:模型必须在脆弱的 Prompt 中死记硬背整个项目的结构,极易产生幻想(Hallucination)。
  • 外部化:持久化记忆提供背景,预定义的技能库(Skills)指引流程,标准协议(Protocols)确保工具调用的精确性。

Agent 设计演进图 图 1:从权重到上下文,再到装具(Harness)的力量重心转移。


核心三支柱:记忆、技能、协议

1. 记忆(Memory):状态的时间外部化

记忆不再仅仅是搜索 RAG 数据库。在装具架构下,记忆分为四个层级:

  • 工作环境(Working Context):实时的任务快照。
  • 情节合集(Episodic Experience):过去失败或成功的教训。
  • 语义知识(Semantic Knowledge):抽象的业务逻辑。
  • 个性化记忆(Personalized Memory):用户的偏好习惯。 这种结构将“回想”(Recall)转化为了“识别”(Recognition),大幅降低了模型的幻觉率。

2. 技能(Skills):专业知识的程序化

技能是外部化的“专家手册”。它不仅是工具(Tools),更是程序化的经验包。它包含操作规程、启发式策略和约束条件。通过将复杂的 Workflow 外部化为可发现、可加载的 SKILL.md,Agent 实现了从“临场即兴发挥”到“按流程执行”的转变。

3. 协议(Protocols):交互的结构化

协议解决了 Agent 与外部世界(工具、用户、其他 Agent)的通信噪音。如 Anthropic 的 MCP 或 Google 的 A2A 协议,它们为交互建立了确定的语法和语义边界。协议让 Agent 之间的协作像微服务架构一样清晰可靠。

部外部化 Agent 架构图 图 2:以装具(Harness)为中心的外部化架构设计。


装具工程(Harness Engineering):Agent 的大脑环境

“装具”是这篇论文最核心的工程贡献。它不仅是一个外壳,而是 Agent 的认知环境。它管理着:

  • 控制流(Control Flow):防止无限递归循环。
  • 沙箱隔离(Sandboxing):确保执行代码不会格式化你的硬盘。
  • 可观测性(Observability):每一阶段的推理过程都清晰可查。
  • 人类介入计划(Human-in-the-loop):在关键决策点设立审批闸机。

深度洞察:为什么这会改变未来的 Agent 开发?

过去我们评估一个 Agent 的好坏,看的是它的基础模型(如 GPT-4 vs Claude 3.5)。但这篇论文告诉我们:一个拥有优秀装具中等模型,其可靠性往往优于一个处于裸跑状态(Unaided)的顶尖模型。

局限性与挑战

尽管外部化带来了可靠性,但也引入了新的开销。组件过多会导致认知过载——模型可能忙于解析复杂的 API 协议而忘记了最终目标。此外,外部文件的安全注入风险(如通过 Skill 文件的 Prompt Injection)也是未来必须攻克的难题。

总结

Agent 的发展已经从关注“模型参数”转向了关注“环境构建”。通过将记忆、技能和协议外部化,我们为 LLM 打造了一套坚固的铠甲。未来的理想 Agent 应该是:内核冷静(Parametric Reasoning),外壳强悍(External Infrastructure)。

一句话 Takeaway:别再纠结怎么写更好的 Prompt 了,去为你的 Agent 构建一套标准化的外部化装具(Harness)吧。

发现相似论文

试试这些示例

  • 查找最近关于 LLM Agent 内存管理中“分层存储”(Hierarchical Memory)与“遗忘机制”协同优化的最新论文。
  • 哪篇论文最早在 AI Agent 领域引入了“认知人工制品”(Cognitive Artifacts)理论,本文提出的 Externalization 逻辑与其有何本质传承?
  • 调研目前工业界主流的 Agent 交互协议(如 Anthropic MCP, Google A2A)在多模态(Vision-Language)任务中的扩展应用现状。
目录
[综述] Agent 工程的新范式:从“更强的模型”走向“更好的外部化装具”
1. TL;DR
2. 这种演进的本质逻辑是什么?
3. 核心三支柱:记忆、技能、协议
3.1. 1. 记忆(Memory):状态的时间外部化
3.2. 2. 技能(Skills):专业知识的程序化
3.3. 3. 协议(Protocols):交互的结构化
4. 装具工程(Harness Engineering):Agent 的大脑环境
5. 深度洞察:为什么这会改变未来的 Agent 开发?
5.1. 局限性与挑战
6. 总结