为何仅靠动作级防护不够——工作流级指导能带来什么
核心转变在于从孤立地检查每个操作,转向引导智能体完成整个流程。PolicyGuide的作者指出,运行时防护措施能够拦截违规操作(例如批准不符合条件的变更),但无法帮助智能体记住执行身份验证或确认等必要步骤。因此,他们将每项策略编译为工作流图,并在用户轮次边界运行主动验证器,以协调未决请求并返回针对具体步骤的修正建议。结果显示:在τ2-bench基准测试(涵盖航空、零售、电信领域)中,平均Pass 4得分从0.42提升至0.62——相对提升48%——其中电信领域增幅最大(从0.19升至0.61),该领域也是工作流结构化程度最高的。这表明,任务越依赖流程性操作,工作流层面的引导就越有效。
另一种方法来自Zwerdling等人,采取了互补的路径:将政策文档编译为可验证的防护代码,附加到工具使用上,然后在每次智能体行动前强制执行合规性。他们在τ-bench航空领域进行了测试,初步结果令人鼓舞。因此,虽然PolicyGuide侧重于主动的全流程验证,这种方法更注重行动层面的确定性、透明防护——但两者都旨在弥合“知晓政策”与“遵循流程”之间的差距。
如何在不增加成本或丧失可审计性的前提下,让智能体更合规?
是的,根据FRAMES,这是一个闭环框架,在保持准确性和成本平衡的同时不断进化智能体技能。它从现有资产冷启动可部署的技能,然后通过共识机制对其进行变异,筛选出准确性与成本之间的帕累托最优方案,并包含防回退保障——也就是说,改进不会意外破坏其他案例。部署在一个内部生产系统上后,FRAMES在所有基线中实现了最佳的准确性-成本权衡,并且同样的收益在τ-bench上也得到了复现。这对实际落地至关重要:如果合规性改进使推理成本翻倍或让智能体的推理过程变得不透明,在企业环境中是行不通的。
防回归保障对工作流层面的趋势尤为重要。当你修改一项策略或技能时,你不希望解决一个合规问题的同时又制造出另一个问题。FRAMES明确防范了这一点,这是其他论文未直接涉及的实际关切。因此,在未来两年内,预计会出现更多不仅引导工作流、还能安全管理工作流演进的系统。
企业智能体实际会改变什么——以及哪些仍然困难
实际结果是,企业智能体在执行多步骤流程时将变得更加可靠,而不仅仅是避免单个错误操作。PolicyGuide在不同智能体(Claude Sonnet 4.6和Gemini 2.5 Pro)之间的迁移表明,这类工作流级系统与具体模型无关,这对经常更换大模型供应商的企业来说是个好消息。此外,它在对抗性用户测试中报告了最低的攻击成功率,这意味着工作流级指导还能提升对类似提示注入攻击的防御能力。
但现实挑战依然存在。Zwerdling等人明确指出了实际部署中的关键难题,例如处理模糊策略以及将防护代码扩展到复杂工作流。此外,收益并不均衡:PolicyGuide在航空领域的提升幅度要小得多(总体从0.42到0.62,但论文指出电信领域提升最大),这表明程序结构化程度较低的领域可能获益较少。因此,未来两年这些系统很可能会逐步成熟,但企业若要充分受益,仍需在策略规范化和工作流设计上投入精力。
关于这些来源
此回答基于3项研究(均为预印本)——发表于2025年至2026年,其中3项为2024年或之后——从3项通过质量筛选的研究中选出最具相关性的,这些研究源自从超过5亿篇论文数据库中检索到的33篇文献。
本文引用的文献
PolicyGuide:从守护单一动作到引导全工作流,实现符合政策的LLM智能体
PolicyGuide将政策编译为工作流图,并在用户轮次边界使用主动验证器,将τ2-bench上的平均Pass 4从0.42提升至0.62,覆盖航空、零售和电信领域,其中电信领域提升最大(从0.19升至0.61),且该方法可迁移至其他LLM智能体。
FRAMES:面向策略治理企业工作流中智能体的受保护与双目标技能进化机制
FRAMES是一个闭环技能进化框架,采用基于共识的变异机制、在准确性与成本之间进行帕累托选择,并具备防回退保障。该框架在内部生产系统上实现了优于基线的准确性-成本权衡,并在τ-bench上复现了性能提升。
推动在智能体工作流中强制执行公司政策合规性
一个确定性的模块化框架,可将政策文档编译为与工具使用相关的可验证守卫代码,并在每次智能体行动前于运行时强制执行。该框架在τ-bench Airlines领域上展示了令人鼓舞的初步结果,并概述了实际部署中的关键挑战。
