运行时契约能否在长程多步任务中避免代理安全错误的重复发生?

运行时合约可以通过在执行时强制执行安全性,来防止长链条多步骤智能体任务中反复出现的错误,其依据来自运行时验证和基于合约的系统的实证支持。

直接答案

是的,运行时契约有助于在长周期多步骤任务中避免重复犯错,但它们并非万能灵药。关键在于,它们是在执行时强制保障安全,而不仅仅是在训练阶段,这对在现实世界中行动的自主智能体至关重要。例如,2026年对52起已记录的AI智能体事件进行审计后发现,许多失败源于缺乏运行时强制执行;另一项对28,560篇AI论文的分析显示,训练时安全与部署时检查的投入比例失衡达8至12倍,前者明显占优。运行时契约,如[3]中提出的方案,增加了预防性门控(阻止危险行为)和证据性检查(验证行为确实发生),直接针对重复错误的根本原因。然而,正如[1]所指出的,契约必须持续维护和更新,以避免在长任务中出现“约束漂移”,因此它们是解决方案中必要但不充分的一部分。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何仅靠训练时的安全性无法应对长期多步骤任务

AI安全的主流方法一直是训练模型使其乐于助人且无害,但对于执行代码、发送消息或修改数据库的智能体而言,这种方法在结构上并不充分。一篇2026年的论文[3]指出,安全必须是由运行环境(harness)强制执行的运行时契约,而不仅仅是训练过程中灌输的一种属性。这一观点得到了对52起已记录的AI智能体和LLM安全事件的调查支持,该调查发现,许多失败之所以发生,是因为缺乏运行时执行机制来在错误发生时及时拦截。此外,对2023至2025年间顶级AI会议(NeurIPS、ICML、ICLR)接收的全部28,560篇论文进行的审计发现,训练时与部署时安全研究之间存在8至12倍的失衡,这意味着该领域一直忽视了在现实任务中防止重复错误所需的关键机制。

这个问题在长程多步骤任务中尤为突出,因为早期的一个小错误可能会引发一连串后续错误。像RLHF(基于人类反馈的强化学习)或DPO(直接偏好优化)这类训练阶段的方法,无法预见到所有可能的行动序列。正如[3]所指出的,安全性的正确单位是“带有可核查证据的轨迹”,而非模型本身。这意味着我们需要对智能体执行的每一步进行监控和验证,而不能仅仅依赖模型习得的行为。

运行时契约如何真正防止重复犯错

运行时合约通过增加两个互补的层面来发挥作用:预防层和证据层。预防层在危险行为发生之前予以拦截,利用沙箱、权限门控、输出过滤器和轨迹监控等手段。证据层则要求提供可验证的证明,以确认良好行为确实发生,并将任务提交与硬性证据挂钩,如测试运行、日志捕获、文件差异和引用溯源。这种双重方法直接得到[3]中关于智能体轨迹模式与证据链的形式化支持,该框架提供了一种组合式的方法来验证每一步。

其他研究从不同角度进一步印证了这一观点。例如,[2][4]提出了一种面向多智能体系统的运行时验证框架,该框架在执行过程中控制事件,而无需对每个智能体进行专门编程以识别这些事件。他们在医院床位分配场景中进行了演示,监控器确保对话流程不偏离轨道,防止可能损害推理的主题漂移。这是运行时监控如何实时捕捉并纠正偏差的一个具体实例,而这正是避免在长任务中重复错误所必需的。

同样地,[5]引入了一个契约自动机的运行时环境,确保实现符合其契约,表明在服务协调中形式化契约可以在运行时得到强制执行。而[6]提出了一种面向多智能体自适应系统的自适应运行时验证方法,将环境因素转化为概率形式以实现自我调节。综合来看,这些研究得出了相同的结论:运行时契约为在错误发生时捕获并纠正错误提供了稳健的机制,这对于长期多步骤任务至关重要。

关键在于:合约必须持续维护,而非仅靠声明

虽然运行时契约功能强大,但并非一劳永逸的解决方案。一篇2026年的论文[1]指出了基于LLM的多智能体系统中“约束漂移”的问题,即随着任务演进,原有的安全约束可能变得过时或被忽视。该论文主张,安全的多智能体行为必须得到持续维护,而非仅仅声明,并提出了一种能适应当前任务上下文的示例性运行时契约。这意味着,对于长期任务,契约本身需要不断更新以反映新信息或变化的需求,否则可能无法捕捉新类型的错误。

这是一个至关重要的提醒:运行时契约是必要的,但并不充分。它们必须被设计为动态且具有响应性的。来自[1]的证据表明,静态契约可能适用于短任务,但对于长期的多步骤任务,契约需要被重新评估和调整。这是一个活跃的研究领域,这里的论文提供了基础,但也凸显了持续工作的必要性,以使契约真正具备适应性。

关于这些来源

本回答基于6项研究(4项经同行评审,2项为预印本),发表于2021年至2026年间,其中2项为2024年或之后发表,1项发表于Q1–Q2期刊。这些研究是从6项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文数据库中检索到的35篇文献。

本文引用的文献

1

安全的多智能体行为必须被持续维护,而非仅仅被宣称:基于LLM的多智能体系统中的约束漂移问题

提出安全的多智能体行为必须随时间得以维持,引入“约束漂移”作为基于LLM的多智能体系统中的风险,并建议采用一个示例性的运行时契约来应对该问题。

2

RV4JaCa——面向多智能体系统与机器人应用的运行时验证

提出了一种基于JaCaMo框架的多智能体系统运行时验证方法,并在医院床位分配场景中展示了对话流程控制,以防止话题偏离。

3

智能体安全应当是一项运行时契约

主张智能体安全应成为一项运行时契约,兼具预防性与证据性两面,并通过对52起AI智能体事故的调研以及对28,560篇AI论文的审计加以佐证,结果显示训练阶段与部署阶段的研究投入存在8至12倍的失衡。

4

RV4JaCa——多智能体系统的运行时验证

与文献[2]类似,本文详细介绍了在医院床位分配的多智能体系统中,用于控制对话流程的监控器的实现,重点强调了在不修改智能体行为的前提下进行运行时验证。

5

合约自动机的运行时环境

介绍了CARE,一个用于契约自动机的运行时环境,能够确保实现与契约保持一致,实验表明其优于手动实现。

6

多智能体自适应系统的运行时验证

提出了一种面向多智能体自适应系统的自适应运行时验证方法,将环境因素转化为概率形式以实现自我调节,并在实际案例中进行了验证。