为何应从明确的规格说明和确定性验证器入手
核心理念是在生成代码之前,让智能体的意图可被审查。与其给智能体一个模糊的提示,不如先定义原则、明确行为、规划架构并生成任务,然后再进行实现。这减少了歧义,也使输出更易于审查[4]。在实践中,这意味着要写下验收标准,并使用确定性验证器来对照这些标准检查智能体的输出。一项针对小型语言模型的研究发现,使用规范验证器相比大型语言模型基线,准确率提升了7.8%至13.2%,并将输出一致性从92%提升至99.8%[1]。对团队而言,这意味着在生产环境中更少的意外和更可预测的行为。
如何逐步将智能体探索转化为确定性、低成本的流程
不要让智能体永远运行所有任务。将智能体的探索视为发现阶段,然后把经过反复验证的行为转化为确定性工作流。一项针对IT运维的生产研究表明,在八个月的时间里,这种“渐进结晶”方法将确定性执行比例从0%提升至45%,并在事件量翻倍的情况下,将单次事件成本降低了超过70%[2]。关键在于建立基于证据的晋升机制:只有经过多次验证的工作流才能晋升为确定性执行,若出现性能回退则予以降级。这种方法提升了可复现性和可审计性,而这两者对安全性至关重要[2]。
何时以及如何扩展到大型复杂任务——以及何时不应扩展
规范优先的方法甚至能应对大规模重构,但前提是必须有严格的验证。一项案例研究在71.7万行代码库中,仅凭形式化规范和31次审计遍历,就拆除了横跨189个文件的核心架构不变量,全程无需人工代码审查,并在任何人实际运行程序前纠正了201个缺陷[3]。其收敛标准是连续两次验证遍历均零发现。然而,这耗费了三天时间和2430美元的计算成本,作者也指出,这原本是一项传统上被认为不可行的任务[3]。对大多数团队而言,这提示应循序渐进:先从较小、边界清晰的任务入手,建立验证循环,只有在拥有扎实规范且预算足以支撑大规模审计时,才尝试大型改动。
让工作流复杂度匹配任务难度
并非所有任务都需要相同程度的规格说明或智能体复杂度。一种具备难度感知能力的编排系统能够动态生成针对具体查询的工作流,对简单查询采用更简洁的工作流,对较难查询则使用更复杂的策略,并且在准确性和效率两方面都优于静态多智能体系统[5]。这与“规格优先”原则相一致:既要定义预期行为,也要定义何时采用更简单或更复杂的方法。对团队而言,这意味着避免对简单任务过度设计,同时确保复杂任务获得必要的规格深度。
关于这些来源
这个回答基于5项研究(1篇同行评审,4篇预印本),发表于2025年至2026年,其中5篇为2024年或之后发表——这些研究是从9项通过质量筛选的研究中选出的最相关者,而这9项研究又源自从超过5亿篇论文的数据库中检索到的54篇文献。
本文引用的文献
小型语言模型与规格驱动开发:构建高精度智能体AI系统
采用规范驱动开发的小语言模型,在准确率上比仅使用大语言模型的基线高出7.8%至13.2%,输出一致性达到99.8%(相比之下基线为92%),并将推理延迟降低了7倍,运营成本降低了近一个数量级。
渐进式结晶:将智能体探索转化为生产中确定性、低成本的流程
在生产型AIOps系统中,渐进式结晶在八个月内将确定性执行率从0%提升至45%,尽管事件数量翻倍,单次事件成本仍降低了70%以上,同时可复现性与可审计性也得到显著改善。
以规范为先导的AI编码代理收敛实践:一项在无测试预言机、无人工代码审查条件下,于717k行代码库中跨189个文件拆除核心架构不变量的案例研究
规范优先的协议使AI编程代理能够在无人工审查的情况下,完成对717k行代码库中189个文件的大规模重构,通过31次审计遍历在执行前修正了201个缺陷,三天内花费2,430美元。
从氛围编码到规范驱动的智能体开发:一种分类体系、生命周期模型与基于工件的实证分析
规范驱动的开发通过使用结构化工件(规则、规范、工作流、技能)以及将原则与需求、任务、代码和测试关联起来的可追溯性模型,减少了歧义并提高了可审查性。
面向查询特定多智能体工作流的难度感知智能编排
难度感知的智能体编排能够根据预测的难度动态生成查询特定的工作流,在六个基准测试中,其在准确性和推理效率两方面均优于静态多智能体系统。
