攻击者如何污染智能体的记忆?
用于智能体记忆的时间知识图谱,是通过动态整合来自持续对话和业务系统的数据而构建的[1]。这意味着,任何输入到智能体的信息——无论是来自用户、API,还是被攻破的数据源——都可能成为图谱的一部分。攻击者可以注入虚假或误导性的事实,而智能体在后续推理中会使用这些事实,从而有效污染其记忆。由于这些系统被设计为长期记忆上下文,这一风险被进一步放大,因此,一个被注入的事实可能影响未来多个会话中的决策。
关于时序知识图谱推理的研究表明,模型可能会被嘈杂或无效的历史事实所误导[2]。事实上,一个动态记忆增强模型的作者明确指出,在推理过程中使用所有历史事实会引入噪声和无效事实[2]。这表明,如果攻击者能够插入看似合理但虚假的事实,智能体可能会将这些事实纳入其预测中,从而导致错误的行动或答案。同一篇论文提出了一种具有容量限制和重复刺激机制的记忆池来过滤有用事实,但此类机制并非万无一失,仍可能被精心构造的注入内容所绕过。
攻击者能否利用基于时间的推理来隐藏或伪造事件?
时序知识图谱需要对跨时间的事件进行推理,它们往往优先考虑近期事实,同时也会利用更早的事实作为背景信息[3]。攻击者可以利用这一点,通过选择注入时机来实施攻击——例如,在模型视为近期的时间戳上插入一条虚假事实,或者用大量近期噪声淹没一条真实事实。模型对近期历史的依赖(如[3]所述)意味着,一连串伪造事件可能会盖过合法事件,导致智能体依据捏造的信息采取行动。
此外,[2]中的动态记忆增强方法使用了一个基于重复频率和时效性来遗忘或强化事实的记忆池。攻击者可能通过反复注入虚假事实使其在记忆中“扎根”,或通过不重复真实事实使其被遗忘。这种时间层面的操纵是一种隐蔽但严重的滥用场景,因为智能体的决策基于一个经过筛选、按时间加权处理的历史视图,而攻击者能够影响这一视图。
使用时序知识图谱作为智能体记忆时,存在哪些隐私与公平性风险?
由于这些图存储了详细的、带时间戳的对话和业务数据记录[1],它们成为数据提取的丰富目标。攻击者一旦获得对图的读取权限——或构造查询使代理泄露存储的信息——就可能提取敏感的个人或企业数据。这些系统长期保留上下文这一关键特性,也意味着数据存续时间更长,从而增加了暴露的时间窗口。
偏差放大是另一个令人担忧的问题。时序知识图谱从历史模式中学习,如果这些模式包含偏差(例如性别或种族刻板印象),智能体可能会延续甚至强化这些偏差。[2]中的记忆增强模型旨在记住“潜在有用的历史事实”,但什么被视为有用可能反映了有偏差的历史数据。类似地,[3]中的记忆触发方法利用早期事实来建立初始表示,这可能会固化过时或有偏差的假设。两篇论文均未涉及公平性问题,但其机制表明,源数据中的偏差会随时间推移而被放大。
关于这些来源
这个回答基于3项研究(2项经同行评审,1项为预印本),发表于2023年至2025年间,其中2项为2024年或之后发表,1项发表于Q1期刊。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的38篇文献。
本文引用的文献
Zep:一种用于智能体记忆的时间知识图谱架构
Zep是一种用于智能体记忆的时间知识图谱架构,在深度记忆检索基准测试中以94.8%对93.4%的成绩优于MemGPT,并在LongMemEval基准测试上将准确率提升了最高18.5%,同时将延迟降低了90%。然而,其对对话数据和业务数据的动态整合也引入了新的攻击面,可能导致记忆投毒和隐私泄露。
基于动态记忆增强的时间知识图谱推理
DyMemR模型用于时序知识图谱推理,引入了一个类似人类记忆的池子,具备容量、遗忘和重复刺激机制,用以筛选有用的历史事实,并明确指出,使用全部历史事实会引入噪声和无效信息,攻击者可能利用这一点注入误导性内容。
记忆触发的时间知识图谱推理
MTDM网络在时序知识图谱推理中利用较早的历史事实建立初始节点表示,并通过近期事实进行更新,但其对近期历史的侧重以及并行更新机制,可能被攻击者利用——通过精心安排注入时机,使近期记忆被其主导。
