运行时契约实际上能带来多少安全性?
运行时合约并非理论构想——它们已在真实智能体系统中得到验证,数据表现强劲。在一项评估中,名为AgentSpec的运行时强制系统在超过90%的代码智能体案例中阻止了不安全执行,在具身智能体任务(如机器人)中消除了所有危险行为,并在自动驾驶场景中实现了100%的合规执行[1]。这意味着,对于典型的编码智能体,每10个危险动作中不到1个能通过;对于物理世界智能体,该系统拦截了所有测试中的危险情况。
另一个框架——智能体行为契约(ABC)——衡量了它能捕捉到多少基线(无契约)会遗漏的违规行为。在1,980个会话中,签订契约的智能体每个会话检测出5.2至6.8个“软性”违规——例如政策违反或轻微规则违规——而这些是未签订契约的智能体完全遗漏的[2]。该效果在统计上非常显著(p < 0.0001),意味着这极不可能是偶然发生的。因此,实际答案是:你可以依赖运行时契约来捕捉绝大多数不安全行为,并揭示许多否则会被忽略的细微问题。
运行时合同的局限与注意事项有哪些?
最大的注意事项在于,规则本身往往由大语言模型生成,而这些规则并非完美无缺。在一项测试中,OpenAI的o1模型为具身智能体生成的规则达到了95.56%的精确率(大部分规则是正确的),但召回率仅为70.96%(约29%的实际风险未被规则覆盖)[1]。这意味着合约的有效性取决于其规则集的质量——如果漏掉一条规则,就会漏掉相应的风险。因此,尽管执行机制高度可靠,规则编写环节仍需人工监督。
另一个局限在于,合约并不能消除所有风险。ABC框架在硬性约束(如“绝不删除沙箱外的文件”)上的合规率达到了88%–100%,但并非始终是100%[2]。而且,从违规中恢复的能力因模型而异:前沿模型在100%的情况下都能恢复,但所有模型的表现范围从17%到100%不等[2]。因此,如果合约检测到违规,它并不总能将智能体恢复到安全状态——尤其是在使用较弱模型时。这意味着在设计合约时,应加入故障安全机制,而不能指望它们总能解决问题。
尽管运行时契约存在不完美之处,为何仍值得依赖?
另一种选择——仅依赖训练阶段的安全措施(如RLHF)——对于执行代码或与现实世界交互的智能体而言,在结构上是不够的。2026年对52起已记录的AI智能体事故的审计发现,许多安全故障发生在运行时,并非因为模型“不安全”,而是因为它采取了在情境中具有危险性的行动[3]。运行时契约增加了一层防护,能在这些行动发生前将其阻断,而且成本低廉:在ABC框架中,每次行动的开销不到10毫秒,在AgentSpec中则为毫秒级[1][2]。相对于巨大的安全收益,这点代价微不足道。
三项研究从不同角度得出了相同的结论:AgentSpec在多个领域展现出高执行率,ABC具备高违规检测率和漂移界限,而立场论文则主张运行时契约是安全性的正确单元,并援引计算机安全与实验科学的证据作为支撑[1][2][3]。它们并不取代训练阶段的安全措施,而是增加了一层可靠、可验证的保障,使智能体在实际应用中更加安全。因此,对于AI安全工程师而言,答案是:是的,你可以将运行时契约作为主要安全机制来依赖,但必须投入于规则质量,并保持人工监督始终在场。
关于这些来源
这个答案基于3项研究(均为预印本)——发表于2025年至2026年,其中3项为2024年或之后——从3项通过质量筛选的研究中选出最相关的,这些研究来自从超过5亿篇论文的数据库中检索到的35篇论文。
本文引用的文献
AgentSpec:面向安全可靠LLM智能体的可定制运行时强制机制
AgentSpec作为一种运行时强制执行的领域特定语言,在超过90%的代码智能体案例中阻止了不安全执行,在具身智能体任务中消除了所有危险行为,并在自动驾驶测试中实现了100%的合规性,且开销仅为毫秒级;由大语言模型生成的规则在具身智能体场景中达到了95.56%的精确率和70.96%的召回率。
智能体行为契约:面向可靠自主AI智能体的形式化规范与运行时强制
Agent行为契约(ABC)在每个会话中检测到5.2–6.8次未签约基线遗漏的软违规(p < 0.0001),实现了88–100%的硬约束合规率,将行为漂移限制在D* < 0.27以内,并在各模型上实现了17–100%的恢复率,且每次操作的开销低于10毫秒。
智能体安全应当是一项运行时契约
一份立场文件主张,智能体安全应作为运行时契约来落实,并通过对52起AI智能体事故的调查、对31个案例的虚假完成审计,以及对12个公开智能体系统的轨迹模式审计加以佐证,表明仅靠训练阶段的安全措施并不足够。
