“治理”对智能体记忆而言,究竟意味着什么?
治理不仅仅是记住更多信息——它关乎控制谁能看到什么、保持事实的一致性,以及能够审计每一次访问。一份2026年的立场文件指出,当今的系统能够回忆起某个事实,却无法可靠地说明谁有权查看它、含义如何因角色而异,或者两个存储的事实是否相互矛盾[4]。这就是你在部署之前需要弥合的差距。
实际组成部分包括:每块内存上的访问规则、不能扩大这些规则的基于角色的投影,以及每次操作的签名收据[4]。另一篇论文将其形式化为“受治理的演化内存”——将内存视为一条状态轨迹,包含摄取、修订、遗忘和检索等操作符,并附带六项正确性条件[5]。两者都认为,仅靠记录级存储无法满足这些条件,无论采用何种数据库模型[5]。
在生产环境中,什么才是真正有效的?
Personize.ai 的一个生产系统采用了双记忆模型——开放集原子事实加上模式强制的类型化属性——并配有分层治理路由和实体级隔离。在受控实验中(N=250,五种内容类型),该系统实现了99.6%的事实召回率、92%的治理路由精确率,并在500次对抗性查询中实现了零跨实体泄漏[1]。这意味着,只要在设计上加以考量,你完全可以同时获得高召回率和严格的隔离性。
同一套系统通过渐进式上下文传递,将令牌使用量削减了50%——只优先发送最相关的记忆——并在每个实体约七条受管记忆时达到输出质量饱和[1]。在LoCoMo基准测试中,该系统达到了74.8%的准确率,表明治理和模式强制并不会损害检索质量[1]。因此,证据表明:你不必为了性能而牺牲治理。
治理何时会失效?
没有任何单一架构能在所有场景中占据主导地位。一项对12种记忆系统的系统性研究发现,其有效性在很大程度上取决于记忆结构与工作负载瓶颈的匹配程度[3]。例如,如果你的瓶颈是频繁更新,那么一个针对检索优化的系统可能在更新正确性上表现不佳。因此,你需要针对自己的工作负载进行测试,而不能仅仅相信某个基准测试的结果。
此外,若在全球范围内进行治理,成本可能很高。同一项研究发现,局部维护比全球重组更具成本效益[3]。而2023年的一项用户研究显示,用户需要透明度和控制权——他们希望看到并操控智能体所记忆的内容,否则会产生错误的心理模型,导致对话中断[6]。因此,治理不仅是技术问题,也关乎用户的自主权。
你现在应该采用什么?
从混合记忆模型开始:同时存储原子事实和类型化属性,实现按实体隔离,并通过闭环模式生命周期让你随时间优化属性[1]。加入反馈循环以捕捉无声的质量退化——一篇论文指出这是关键失败模式[1]。如果你需要捕捉复杂关系,考虑使用基于图的记忆;在LoCoMo基准测试中,它比基础记忆准确率提高约2%[2]。
在成本方面,Mem0 表明,与全上下文方案相比,你可以将 p95 延迟降低 91%,令牌成本降低超过 90%,同时在 LLM 作为评判者的指标上仍比 OpenAI 的记忆系统高出 26% [2]。这对生产环境来说是一个巨大的优势。但请记住:治理并非一次性设置。你需要持续验证你的记忆系统是否符合访问规则和一致性条件,尤其是在你的智能体不断演进的情况下 [3][5]。
关于这些来源
这个回答基于6项研究(3项经同行评审,3项为预印本),发表于2023年至2026年间,其中5项为2024年或之后发表。这些研究是从8项通过质量筛选的研究中选出的最相关者,而这8项研究又源自从超过5亿篇论文的数据库中检索到的43篇文献。
本文引用的文献
治理记忆:多智能体工作流的生产架构
在受控实验中(N=250,五种内容类型),一种生产级记忆架构实现了99.6%的事实召回率、92%的治理路由精度、50%的令牌缩减、在500次对抗性查询中零跨实体泄漏,以及在LoCoMo上74.8%的准确率,表明治理并不会损害检索质量。
Mem0:以可扩展的长期记忆构建生产级AI智能体
Mem0作为一种可扩展的记忆架构,在LOCOMO基准测试中超越了六类基线方法,相较于OpenAI,在LLM-as-a-Judge评估中实现了26%的相对提升,同时与全上下文方法相比,p95延迟降低了91%,并节省了超过90%的令牌成本。
我们准备好迎接智能体原生内存系统了吗?
对11个数据集中的12种记忆系统进行系统研究后发现,没有任何单一架构占据绝对优势;其有效性取决于工作负载瓶颈的匹配程度,且局部维护比全局重组更具成本效益。
代理记忆中的治理缺口
一份立场文件提出了“基底-透镜-框架”(SLF)协议,这是一个自主、可审计的记忆协议,其中事实携带访问规则,透镜投射出面向消费者的视图,且每项操作都会生成签名收据,从而解决了智能体记忆中存在的结构性治理空白。
Agent记忆是数据库吗?重新思考长期AI Agent记忆的数据基础
本文以四个状态级算子(摄取、修订、遗忘、检索)和六个正确性条件形式化定义了受控演化记忆(GEM),并论证了无论采用何种存储模型,任何记录级系统都无法满足这些条件。
记忆沙盒:面向对话代理的透明交互式记忆管理
一项用户研究(Memory Sandbox)发现,用户缺乏查看和控制对话代理记忆内容的可供性,导致心智模型不佳并出现交互故障;将记忆视为可操作的数据对象能够提升用户的主控感。
