AI智能体在长期任务中的可靠性如何?
简短回答:不太行。目前最现实、最严谨的研究——2025年发布的《科学板》(ScienceBoard)——测试了最先进的AI智能体(GPT-4o、Claude 3.7、UI-TARS)在生物化学、天文学和地理信息学领域的169个真实科研工作流。这些智能体需要使用专业软件、操作动态界面并完成多步骤任务,整体成功率仅为15%[2]。这意味着,每交给AI智能体100个长期运行的任务,大约85个会失败或产生错误结果。这并非小众发现:一项涵盖2020年至2024年AI智能体研究的综述同样得出结论,大语言模型在“复杂程序性任务中表现不稳定”,且难以应对需要动态交互的任务[1]。
即使在更简单、定义明确的自由编程任务中——这些任务结构清晰且可测试——表现最好的模型(Claude 3.5 Haiku)也只赚到了约152万美元,而潜在总报酬远高于此,这意味着它仍有大量任务未能完成或回答错误[3]。作者明确指出,“在结构化任务上的表现与现实自由职业工作真实复杂性之间存在差距”[3]。因此,对于杂乱、耗时较长的任务而言,ScienceBoard提出的15%这一数字可能更接近真实情况。
为何智能体频频失败,我们能否修复它们?
智能体失败主要有三个原因。首先,它们缺乏稳健的状态管理能力:如果任务被中断,或需要跨多个步骤记忆上下文,当前的智能体就会失去线索。2026年提出的一种名为“智能体状态管理”(ASM)的框架,通过引入形式化状态机,让智能体“在中断后无缝暂停并恢复工作”,但这仍是一个提议中的解决方案,尚未得到验证[5]。其次,智能体会遭遇不可预测的故障,如幻觉、执行错误和推理不一致。2026年提出的一种自愈框架能够检测这些故障并触发自适应重新规划,早期测试显示其“显著提高了任务成功率”,但同样,该框架尚未在ScienceBoard基准测试的规模下得到验证[6]。第三,智能体难以适应训练数据中未出现过的新任务。一种方法是在运行时为其提供外部知识(例如操作手册),这虽然提高了准确性,但仍未达到可靠性能的水平[1]。
一篇2025年的评估框架论文指出,当前基准测试过度强调准确性,却忽视了成本、鲁棒性和长期适应性——而这些正是长期运行任务中至关重要的维度[7]。因此,该领域已意识到这些差距,新的框架也正在涌现,但尚未有任何一个能够弥合可靠性方面的鸿沟。
智能体能否在无人监督下被信任?
尚未实现,或许短期内也难以实现。一篇2021年关于人机协作的论文指出,在复杂现实场景中,可调节自主性——即人类可在任何时刻介入——至关重要[8]。这并非AI的缺陷,而是承认在动态环境中执行长期任务时,需要当前智能体无法可靠做出的判断决策。另一篇2021年关于金融领域智能投顾的论文强调,对自动化系统的信任取决于可解释性(XAI),且人类将机器人视为辅助工具而非替代品[9]。其启示在于:即便智能体持续改进,在可预见的未来,长期任务中最值得信赖的配置仍将需要人类监督。
最乐观的前进路径来自一篇2026年的论文,该论文提出通过结合互联网规模的数据、用于推理的大型语言模型以及统一的视觉-语言-行动架构来构建“基础智能体”[4]。作者承认这是一个“开放性挑战”,且当前系统面临“三个关键局限”:交互式训练数据的稀缺性、将高层目标落地为长期行为的困难,以及感知、语言和运动控制之间的割裂[4]。因此,即便最雄心勃勃的路线图也承认,我们尚未达到这一目标。
关于这些来源
该答案基于9项研究(1篇经同行评审,8篇为预印本)构建而成——这些研究发表于2021年至2026年间,其中7篇为2024年或之后发表,累计被引用123次——从通过质量筛选的10项研究中选出的最相关成果,这些研究则源自从超过5亿篇论文数据库中检索到的43篇文献。
本文引用的文献
使用AI智能体解决现实世界任务
一篇涵盖2020至2024年研究的2024年学位论文指出,大型语言模型在需要动态交互的复杂程序性任务中表现不一致,并提出了新的基准测试、一种用于智能体的Python程序形式化方法,以及外部知识增强技术以提升准确性。
ScienceBoard:在真实科学工作流中评估多模态自主智能体
一项2025年的基准测试(ScienceBoard)对169个真实科学工作流进行了评估,结果显示,最先进的智能体(GPT-4o、Claude 3.7、UI-TARS)整体成功率仅为15%,表明它们尚无法可靠地协助科学家完成复杂工作流。
AI自由职业者能否竞争?大规模评估其收入、可靠性与任务成功率
一项2025年针对自由编程任务(基于真实招聘信息模拟)的基准测试显示,表现最佳的模型(Claude 3.5 Haiku)在可能的总收入中赚取了152万美元,但作者指出,结构化任务与现实世界的复杂性之间仍存在差距。
基于互联网知识与大语言模型构建基础智能体
一篇2026年的学位论文提出,通过结合互联网规模数据、用于推理的大语言模型以及统一的视觉-语言-动作架构来构建基础智能体,但同时也指出了三个关键局限:交互数据稀缺、难以处理长期目标,以及系统组件碎片化。
面向长时间运行的AI任务的主体状态管理(ASM)框架
一篇2026年的论文提出了智能体状态管理(ASM)框架,这是一种形式化的状态机与数据模型,使智能体能够在中断后暂停并恢复长时间运行的任务,但该框架目前仍处于提议阶段,尚未经过大规模验证。
面向基于LLM的可靠自主智能体的自愈框架
一篇2026年的论文提出了一种面向大语言模型智能体的自修复框架,该框架整合了故障检测、可靠性评估以及通过自适应重规划实现的自动恢复功能;早期实验表明,该框架显著提升了任务成功率。
超越准确性:面向真实世界AI代理的多维度评估框架
一篇2025年的论文指出,当前对AI智能体的评估过度强调准确性,而忽视了成本效益、对动态环境的鲁棒性以及长期适应性,并提出了一个多维度评估框架。
人机协同与可调自主性在实践中的应用
一篇2021年关于人机协作的论文主张在复杂的现实场景中采用可调节的自主性,认为在动态环境下,人类的监督对于确保可靠表现仍然至关重要。
机器人投顾:少些人工智能,多些可解释人工智能?
一篇2021年关于金融领域智能投顾的论文强调,对自动化系统的信任取决于可解释性(XAI),并且人类将机器人视为决策的补充而非替代。
