[综述] Agent 的进化:从模型权重到“外部化”认知基础设施

Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering

Chenyu Zhou, Huacan Chai, Wenteng Chen, Zihan Guo, Rong Shan, Yuanyi Song, Tianyi Xu, Yingxuan Yang, Aofan Yu, Weiming Zhang, Congming Zheng, Jiachen Zhu, Zeyu Zheng, Zhuosheng Zhang, Xingyu Lou, Changwang Zhang, Zhihui Fu, Jun Wang, Weiwen Liu, Jianghao Lin, Weinan Zhang
总结
问题
方法
结果
要点
摘要

本文提出了 Externalization (外部化) 这一统一视角,综述了 LLM Agent 从模型权重向外部基础设施转型的技术趋势。文章系统性地定义了基于核心框架 Harness (装具) 的三大外部化维度:Memory (外部化状态)、Skills (外部化专业知识) 和 Protocols (外部化交互)。

TL;DR

未来的 AI Agent 进步,可能不再取决于模型参数的堆砌,而在于其周围的“装具”(Harness)有多成熟。上海交大与 OPPO 等团队近日发布深度综述,提出了 Externalization (外部化) 理论:通过将记忆、技能和交互协议从模型内部剥离到外部结构中,Agent 能够将复杂的认知负担转化为更可靠的“识别”与“组合”任务。

背景定位:Agent 设计的“大航海时代”

在过去两年里,我们经历了从“能力在权重中 (Weights)”(依靠预训练)到“能力在上下文中 (Context)”(依靠提示词工程)的转变。现在,我们正迈向第三阶段——“能力在装具中 (Harness)”

Agent 设计的组织原则 图 1:从人类文明史看 AI 外部化的演进:从语言、文字到今天的 AI Harness

痛点深挖:为什么单一 LLM 无法成为合格的 Agent?

未经辅助的 LLM 在处理复杂任务时存在三个致命错位:

  1. 短期记忆局限:Context Window 再大也是碎片化的,缺乏跨 Session 的持久状态。
  2. 执行方差过大:即便模型“知道”怎么做,每次生成的流程(Workflow)可能完全不同,缺乏工业级的稳定性。
  3. 协作协议缺失:模型与工具、API 的交互往往依赖模糊的 Prompt,导致调用极其脆弱。

核心方法:外部化三剑客

文章提出,Agent 的外部化由三个关键维度支撑,它们通过 Harness (装具) 统一调度:

1. Memory (外部化状态)

记忆不再只是一个简单的数据库,而是一个受控的生命周期

  • Working Context:当前的中间状态(类似操作系统的寄存器)。
  • Episodic Experience:过去干了什么、哪儿错了(类似人类的经历)。
  • Semantic Knowledge/Personalized Memory:从经历中抽象出的事实与偏好。
  • 物理直觉:将“回忆”任务转化为“索引与检索”任务,降低模型负担。

2. Skills (外部化专业知识)

技能(Skills)是高于 API 调用的抽象。它不仅包含“能做什么”,更包含“怎么做更好(Heuristics)”以及“哪些不能做(Constraints)”。

  • 从生成到组合:Agent 不再是每次即兴发挥,而是从技能库中“加载”经过验证的操作指南。
  • 核心图表展示了技能的生命周期

技能即外部化专业知识 图 2:技能的获取、封装与运行时绑定流程

3. Protocols (外部化交互)

协议是将模型输出转化为“确定性行动”的契约。

  • MCP (Model Context Protocol):如 Anthropic 提出的标准,解耦工具生态。
  • A2A (Agent-to-Agent):定义代理人之间的信息交换指南。
  • 价值:将模糊的对话式沟通转变为机器可读的标准合同,实现跨厂商协作。

Harness:Agent 的“操作系统”

Harness 并不是第四个维度,它是承载前三者的运行环境。一个成熟的 Harness 需要具备:

  • 控制流控制:防止递归爆炸,管理 Token 预算。
  • 沙箱隔离:确保代码操作不会真的毁掉宿主机。
  • 人类干预闸门:高风险操作必须停下来等审批。

Harness 架构图 图 3:Harness 作为认知环境:核心模型被记忆、技能、协议及治理层包围

实验与洞察:Parametric vs. Externalized

论文深入探讨了一个核心权衡:哪些能力该留在权重里,哪些该拿出来?

  • 更新频率高、需审计、需跨代理重用的能力 —— 必须外部化
  • 底层常识、通用推理、低延迟响应 —— 保留在参数中

深度洞察与总结

Takeaway:未来的开发者可能不需要频繁微调(Fine-tuning)模型来适配业务逻辑,而是通过编写 SKILL.md 和配置 Memory Policy 来优化 Agent。

局限性:外部化会带来额外的认知开销——模型需要花费 Token 去“阅读”说明书。如果外部化过度,Agent 可能会陷入“行政冗余”,迷失在繁琐的协议逻辑中。

展望:从数字 Agent 到具身智能(Embodied AI),“大脑(大模型计划)”与“小脑(外部化动作算子)”的分离已经成为必然。Agent 终将不仅仅是一个模型,而是一套严密组织的认知系统。

发现相似论文

试试这些示例

  • 查找最近关于 LLM Agent 外部化内存系统 (Externalized Memory Systems) 中如何解决长程上下文遗忘问题的最新 SOTA 方法。
  • 哪篇论文最早系统性地定义了 Cognition Artifacts 在人工智能中的应用,本文提到的 Harness Engineering 是如何借鉴该理论的?
  • 探讨将外部化技术(如 Skills 和 Protocols)应用到具体垂直领域(如自动驾驶或多模态具身智能)中的最新研究进展。
目录
[综述] Agent 的进化:从模型权重到“外部化”认知基础设施
1. TL;DR
2. 背景定位:Agent 设计的“大航海时代”
3. 痛点深挖:为什么单一 LLM 无法成为合格的 Agent?
4. 核心方法:外部化三剑客
4.1. 1. Memory (外部化状态)
4.2. 2. Skills (外部化专业知识)
4.3. 3. Protocols (外部化交互)
5. Harness:Agent 的“操作系统”
6. 实验与洞察:Parametric vs. Externalized
7. 深度洞察与总结