委派安全将如何改变智能体的协作方式?
如今,当AI代理启动一个会话时,它会获得一组固定的权限,并在整个会话期间保持不变。每个请求都是独立检查的,不会考虑代理之前做了什么。这意味着代理可能将单独允许的操作组合成有害行为,或者毫无限制地将权限委托给子代理。新一轮的委托安全机制用“监管链”取代了这种做法:每当代理A委托给代理B时,系统会精确记录B获得了哪些权限,而这些权限只能少于A的权限,绝不能多于A。这被称为“单调衰减”——用通俗的话说,就是权限在链条中向下传递时只会缩小,绝不会扩大[4]。其实际效果是,被攻破的子代理无法超出其狭窄范围进行权限提升,而且整个链条事后可以被审计。
这一转变最有力的证据来自一项研究,该研究在3154个真实攻击场景中测试了一个名为“智能体主链”(APC)的系统。当该系统强制执行包含六次授权检查的委托链时,AgentDojo基准测试中四个领域的数据窃取率从75%–100%降至0%,并且它拦截了InjecAgent基准测试中全部544起数据窃取案例[1]。这不是理论上的承诺——而是在现实攻击套件上测得的实际结果。同一项研究还表明,将每个操作绑定到原始用户意图后,破坏性操作从38.6%降至4.0%,操纵行为从90.5%降至12.1%[1]。因此,这一变化不仅关乎防止数据盗窃,更在于从一开始就阻止智能体被诱骗做出有害行为。
这有什么陷阱?这些系统真的能验证智能体在按用户意图行事吗?
诚实的答案是:密码学部分固若金汤,但验证意图——即智能体的行为是否真正符合人类的期望——仍然是薄弱环节。一项针对联邦多智能体系统框架SentinelAgent的研究证明,确定性意图验证实际上是不可能的[2]。在他们的测试中,一个使用改写手法的老练攻击者能在13%的情况下骗过意图检查模型,尽管其他六项安全属性在压力测试下都表现完美[2]。这意味着,能够精心构造措辞提示的攻击者或许仍能让智能体做出非预期行为,但他们会被限制在允许的API调用、合规输出和可追溯操作范围内——因此损害是有限的。
这是一个关键细节:安全系统的设计原则是故障时保持安全。即使意图验证失败,其他层级——比如范围合规和级联遏制——仍能阻止对手造成灾难性破坏。同一项SentinelAgent研究表明,当他们针对政府特定的委派示例微调意图模型时,恶意意图检测的真正阳性率从1.7%跃升至88.3%[2]。这表明弱点并非无望;关键在于在正确的领域训练意图模型。但这也意味着,在未来两年内,我们应预期委派安全在防止未授权操作方面表现出色,但在捕捉每一个巧妙伪装的恶意意图方面并非完美无缺。
组织使用多智能体AI的方式将发生哪些实际变化?
对组织而言,最直接的变化将是能够将任务委托给AI代理,而无需担心权限失控。与其给代理一个数据库的广泛访问权限并寄希望于它循规蹈矩,不如签发一个一小时后过期、只能读取特定字段、且只能向下传递一级子代理的令牌。这正是委托能力令牌(DCT)所提供的:防止伪造的加密签名、限制暴露时间的时间界限,以及用于审计的链式追踪[4]。同样,代理式JWT(A-JWT)将每个操作绑定到可验证的用户意图和特定的工作流步骤,并以亚毫秒级开销阻止越权请求、重放攻击和身份冒充[3]。这一开销至关重要——它意味着安全机制不会拖慢代理的工作速度。
另一个重大变化是问责机制。借助人类委托溯源(HDP)等协议,委托链中的每一个操作都可以追溯到授权它的那个人,只需一个公钥和一个会话ID——无需任何第三方注册表[5]。这对金融、医疗等受监管行业来说是个颠覆性的改变,因为你需要证明谁授权了什么。这里的多篇论文得出了相同的结论:多智能体工作流的未来,是委托变得明确、有边界、可审计,而不是隐晦且无限制的。这项技术已经在标准化进程中——HDP是IETF草案,Agentic JWT也与正在进行的OAuth讨论保持一致[3][5]。因此,在两年内,我们很可能会看到这些协议被嵌入企业AI平台,让运行大规模智能体集群并配备细粒度、密码学强制的权限成为常态。
关于这些来源
此回答基于5项研究(均为预印本)——发表于2025年至2026年,其中5项为2024年或之后——这些研究是从7项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的52篇文献。
本文引用的文献
有界智能体:多智能体AI系统的委托安全
在包含3,154个实例(涵盖InjecAgent、AgentDojo和ASB)的大规模评估中,Agentic Principal Chain将AgentDojo所有领域的数据外泄率从75%-100%降至0%,拦截了全部544个InjecAgent数据窃取案例,并将破坏率从38.6%降至4.0%、操纵率从90.5%降至12.1%,同时授权延迟的p99仅为0.24毫秒。
SentinelAgent:用于保障联邦多智能体AI系统安全的意图验证委托链
SentinelAgent的委托链演算强制实施了六项确定性属性(通过TLA+模型检查在270万个状态上验证)以及一项概率性意图属性;它在DelegationBench v4上实现了100%的真阳性率,且假阳性率为0%,但面对复杂改写时,意图验证降至13%,在对190个政府示例进行微调后,真阳性率提升至88.3%。
Agentic JWT:面向自主AI智能体的安全委托协议
Agentic JWT(A-JWT)将每个智能体操作绑定到可验证的用户意图和工作流步骤,利用单向校验和哈希实现智能体身份和持有证明密钥;一个Python概念验证系统以亚毫秒级开销阻止了越权请求、重放、冒充和提示注入路径。
委托能力令牌:面向自主AI代理的加密权限委托机制
委托能力令牌(DCT)提供了一种具有单调衰减特性的密码学令牌格式(被委托的令牌仅拥有更少的权限),支持Ed25519签名、时间限制、链追踪以及再委托限制,其设计借鉴了基于能力的安全模型、Macaroons和Biscuits。
HDP:一种面向智能体AI系统中人类委托溯源性的轻量级密码协议
人类代表团溯源(HDP)协议以密码学方式捕获多智能体系统中的人类授权上下文,将每次委派记录为仅追加链中的签名跳转,且仅凭签发者的Ed25519公钥和会话ID即可离线验证;该协议已作为IETF草案发布。
