多智能体AI的委派安全能否避免长程多步任务中的重复错误?

委托安全可以通过追踪权限并检查每一步,来防止多智能体AI中的重复错误,但这会牺牲一些效用,且需要仔细配置。

直接答案

是的,委派安全机制能够显著减少长链条多步骤任务中的重复错误,但并非没有代价。通过追踪委派权限并将每个操作与先前操作进行核对,像“智能体主链”这样的系统在测试中将数据窃取攻击率从75%-100%降至0%[1]。然而,这种安全性伴随着一定的效用成本——在某些场景下任务成功率会降低约8至14个百分点[1]——并且当约束条件以显式状态维护而非仅作声明时,其效果最佳[3]

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

委托安全究竟如何阻止重复犯错?

委托安全的工作原理是追踪谁授权了什么,并将每个新操作与会话中累积的历史记录进行核对——而不仅仅是初始权限。代理主体链(APC)[1]通过六项授权检查来实现这一点,同时向前传递并限制委托的范围和预算。这意味着,如果代理试图将两个单独允许的操作组合成一个被禁止的结果,系统会捕捉到这一行为,因为它记住了之前的操作。

数据说明一切:在3,154个实例的测试中,APC在InjecAgent基准测试中拦截了全部544起数据窃取案例,并将AgentDojo中四个领域的数据外泄率从75-100%降至0%[1]。意图绑定——确保智能体专注于任务——将破坏率从38.6%降至4.0%,操纵率从90.5%降至12.1%[1]。对普通用户而言,这意味着即使攻击者试图注入恶意指令,系统也不太可能泄露你的数据或采取有害行动。

有什么代价?安全措施会拖慢速度或影响性能吗?

主要的权衡是任务效用的轻微下降。在AgentDojo测试中,当启用安全措施时,两个场景下的效用(即代理完成预期任务的效果)分别降低了8.6和13.9个百分点[1]。这确实是一个实际成本,但与安全收益相比,这个代价相对较小——而且延迟开销微乎其微:在空闲主机上,第99百分位的延迟仅为0.24毫秒[1],因此你不会察觉到任何变慢。

另一个注意事项:安全保证仅在特定条件下得到证明。论文指出,“组合健全性”——即禁止的组合会被拦截这一保证——仅对完整的限制集和串行准入成立[1]。通俗地说,如果你没有事先定义所有限制,或者操作可以并行发生,那么保护可能并非滴水不漏。此外,评估采用了“受损模型”设置,将攻击调用插入在合法工具调用之后,这模拟了最坏情况,但可能无法覆盖所有现实世界的攻击路径。

为什么即使有防护措施,错误仍然会发生?

即使采用了委派安全机制,错误仍可能反复出现,因为安全约束往往会“漂移”——它们在经过记忆、委派、沟通和工具使用的过程中会丢失、扭曲或弱化[3]。关于约束漂移的论文指出,提示和护栏是必要的但不够充分;约束必须作为显式的执行状态来维护,而不仅仅是在开始时声明一次[3]。这与APC方法一致,该方法在每一步都延续并限制委派范围[1]

逐步验证研究[4]进一步印证了这一点:过程监督——即检查每一个中间步骤——在训练模型解决复杂数学问题时,显著优于结果监督(仅检查最终结果)。经过过程监督的模型,在MATH测试集的一个代表性子集上解决了78%的问题[4]。虽然这涉及的是数学推理,但其中的原理具有普适性:检查每一步,而非仅检查最终输出,是防止错误累积的关键。因此,委派安全性固然有帮助,但必须与对约束条件的持续监控相结合,才能真正避免重复犯错。

关于这些来源

这个回答基于4项研究(1篇同行评审,3篇预印本)——发表于2022年至2026年间,其中2篇为2024年或之后发表,1篇发表于Q1期刊,合计被引用63次——这些研究是从4项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的39篇文献。

本文引用的文献

1

有界智能体:多智能体AI系统的委托安全

代理主体链(APC)在544个InjecAgent案例中将数据窃取攻击降至0%,并将AgentDojo的敏感信息外泄率从75-100%降至0%,同时仅带来8.6-13.9个百分点的效用成本,以及第99百分位下0.24毫秒的延迟。

2

面向复杂时序逻辑任务的安全保持多智能体协同

提出了一种协调算法,该算法为多智能体团队综合最优计划,以在实现线性时序逻辑任务的同时,保护每个智能体免受被动入侵者的安全威胁,并在真实世界实验中进行了验证。

3

安全的多智能体行为必须被维护,而非仅仅被宣称:基于LLM的多智能体系统中的约束漂移

认为基于LLM的多智能体系统中的安全关键约束往往会“漂移”——随时间推移而失效——并提出了约束状态治理机制,将其作为显式执行状态来维护,而非仅仅加以声明。

4

让我们一步一步验证

过程监督(检查每个中间步骤)在MATH数据集上训练模型时显著优于结果监督,采用过程监督的模型能够解决代表性子集中78%的问题。