代理的部署工作流能否在长程多步任务中避免重复犯错?

是的——部署工作流可以通过步骤级验证、选择性检查和回滚机制,防止长时间多步骤智能体任务中重复犯错,近期研究已提供相关证据。

直接答案

是的,部署工作流确实能显著减少长链条多步骤智能体任务中的重复性错误,但前提是它们必须验证中间步骤,而不仅仅是最终结果。2023年的一项研究发现,过程监督(检查每一步推理)优于结果监督,在数学问题上的解决率达到78%,而仅依赖结果反馈的准确率较低[3]。另一个2025年的系统Sherlock采用选择性验证和回滚机制,相比无验证方案准确率提升了18.3%,同时与非推测性执行相比,执行时间最多缩短了48.7%[2]。所以答案是肯定的,但这需要精心设计——不能只是指望智能体从过去的错误中自行学习。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么逐步检查胜过只检查最终答案

研究得出的核心洞见是,在长任务中,错误往往发生在中间步骤,如果只检查最终输出,就会错过根本原因。OpenAI研究人员在2023年的一项研究中比较了两种训练模型的方式:仅对最终答案给予反馈(结果监督)与对每个中间推理步骤给予反馈(过程监督)。采用过程监督的模型在一个具有挑战性的数学数据集中解决了78%的问题,显著优于采用结果监督的模型[3]。这意味着,要避免重复犯错,你需要在错误发生时及时捕捉并纠正,而不是等到最后才处理。

这一发现得到了2025年一个名为Sherlock的系统的进一步印证。该系统通过分析智能体工作流,识别出最易出错的步骤,并仅在必要之处附加验证机制。在测试中,与无验证的基线相比,Sherlock平均将准确率提升了18.3%[2]。关键在于验证是有选择性的——并非每一步都需要昂贵的检查,但那些可能出错的步骤则必须覆盖。这种方法在可靠性与效率之间取得了平衡,而这对于实际部署至关重要。

回滚与可复用工作流如何防止错误层层叠加

部署工作流避免重复错误的另一种方式是,在某个步骤失败时回滚到最后一个已验证的状态,而不是让错误继续传播。Sherlock正是这样做的:它在后台运行验证的同时,推测性地执行下游任务;如果验证失败,就回滚到最后一个已验证的输出[2]。这能防止小错误滚雪球般演变成更大的问题。同样的原则也出现在SKILL.nb中,这是一个2026年的框架,将工作流存储为带验证门的版本化笔记本。当某个步骤的可执行代码因环境漂移而失败时,它会回退到自然语言指导,即使底层系统发生变化也能保持性能[1]

复用以往的工作流也有助于避免错误,但前提是这些工作流得到妥善管理。SKILL.nb发现,如果没有生命周期管理,复用的工作流往往会在新条件下失效。在他们的测试中,SKILL.nb在三次重新执行中保留了91.7%的初始成功任务,比次优方法高出15.5个百分点[1]。这表明,仅仅保存工作流是不够的——你需要监控其性能,并在环境变化时进行调整,否则你会在新情境中重蹈覆辙。

有什么陷阱?验证需要时间和金钱,而且并非所有任务都同等重要。

主要的权衡在于,验证会增加延迟和成本。Sherlock的选择性方法相比基于蒙特卡洛搜索的方法,将验证成本降低了26%,但仍会带来额外开销[2]。2023年的过程监督研究也指出,人工反馈成本高昂,因此他们采用主动学习,只对信息量最大的步骤进行标注[3]。所以,尽管逐步验证效果强大,但并非没有代价——你必须决定将验证预算花在何处。

此外,相关证据来自特定领域:数学推理、网页自动化和IT工作流。2021年一项关于部署太阳能无人机以恢复通信的研究使用了智能体评估算法来规划路径,但其重点在于能量和姿态误差等物理约束,而非大语言模型的推理能力[4]。而2023年一篇关于在云平台中串联AI智能体的论文讨论了编排策略,但未提供任何量化结果[5]。因此,关于避免重复犯错的最有力证据来自基于大语言模型的推理和网页任务,而非所有可能的智能体应用场景。如果你在不同领域部署智能体,可能需要调整这些原则。

关于这些来源

这个回答基于5项研究(1篇同行评审,4篇预印本)——发表于2021年至2026年间,其中2篇为2024年或之后发表,1篇发表于Q1期刊,合计被引用71次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇文献数据库中检索到的34篇论文。

本文引用的文献

1

SKILL.nb:面向持久化智能体工作流的选择性形式化与门控执行

SKILL.nb是一个用于管理可复用智能体工作流的框架,在WebArena-Verified上实现了53.7%的单轮成功率(比基线高出3.9个百分点),在三次重新执行中保留了91.7%的初始成功任务(比次优方案高出15.5个百分点),并以仅4.2%的回退率恢复了72.9%的后续失败,这表明生命周期治理和门控条件执行能够提升可靠性。

2

Sherlock:可靠且高效的智能体工作流执行

Sherlock系统能够选择性地将验证器附加到智能体工作流中容易出错的节点上,并采用带回滚的推测执行机制。与不进行验证的基线相比,该系统平均准确率提升了18.3%;与非推测执行相比,执行时间最多缩短了48.7%;与基于蒙特卡洛搜索的方法相比,验证成本降低了26%。

3

让我们一步一步验证

在一项关于训练大语言模型进行数学推理的研究中,过程监督(对每个中间步骤提供反馈)显著优于结果监督(对最终结果提供反馈),其中经过过程监督的模型能够解决MATH测试集代表性子集中78%的问题,而主动学习进一步提升了过程监督的效果。

4

多无人机系统在通信恢复部署中的智能体评估

在一项针对部署太阳能无人机以恢复通信的仿真研究中,作者提出了两种路径规划算法(DCPPA和GCSPPA)来评估智能体分配,建立了快速收敛的条件,并在不同规模下展示了准确性和有效性,但这与LLM推理无关,且未提供定量精度数据。

5

在PaaS架构中链式编排AI代理,以实现多步骤工作流自动化

一篇2023年的论文探讨了在PaaS架构中链接多个AI代理以实现多步骤工作流自动化,提出了架构设计和编排策略,并附有IT事件响应方面的案例研究,但该论文未提供定量结果或实证评估。