为什么智能体基准测试掩盖了真实的失败率?
大多数智能体基准测试在发布时固定一组任务,并且只对最终回答进行评分,这忽略了智能体是否真正正确执行了工作流程。本研究中规模最大的项目Claw-Eval-Live构建了一个动态基准测试,它从真实需求中刷新任务,并检查执行轨迹、审计日志和工作区产物——而不仅仅是答案。在105项任务中,领先模型仅通过了66.7%的任务,且没有任何模型达到70%,这意味着即使是最优秀的智能体在约三分之一的现实工作流程中也会失败。最终答案准确性与真实执行成功之间的这种差距,正是静态基准测试无法揭示的问题。
同一项研究发现,失败按任务族类呈现结构性分布:人力资源、管理和跨系统业务流程是持续存在的瓶颈,而本地工作区修复相对容易,但尚未达到饱和。这表明,与现实需求同步演化的协同工作流——即随实际需求变化的工作流——会暴露出那些经过精心策划、固定不变的任务集所无法揭示的弱点。作者得出结论,评估应基于新鲜的外部需求和可验证的智能体行为,而不仅仅是排行榜分数。
共同演化的技能,能揭示哪些静态任务无法展现的东西?
共同演化的技能——从过往运行中提炼出的可复用模式——能够提升可靠性,但静态基准测试很少衡量这一点。在COMFYCLAW这一图像生成工作流系统中,从先前轨迹、错误和验证器反馈中演化出技能库的智能体,在所有六种智能体配置中均优于仅依赖验证器的基线。人工标注者也更偏好技能演化版本。这表明,积累并复用技能的能力是性能的关键驱动因素,然而在那些测试一次性任务、不包含记忆或演化组件的基准测试中,这一能力仍然不可见。
同样地,EvoOR-Agent针对优化问题协同进化智能体架构与推理路径,并持续优于零样本大语言模型和固定流程智能体。作者将性能提升归因于对工作流拓扑和推理轨迹的显式进化。综合来看,这些研究表明,协同进化工作流与技能并非锦上添花——它们是能切实提升实际性能的机制——但标准任务评估无法捕捉这些优势,因为评估中不允许学习或适应。
关于协同演进工作流,人类研究揭示了什么?
除了技术基准之外,定性研究还表明,共同演进的工作流程同样在改变人类的角色和技能组合,而基于任务的评估往往忽视了这一点。在一项2025年对十位应用艺术从业者的访谈研究中,参与者将生成式人工智能描述为加速构思的共同创作者,但也对创意同质化和数据使用的伦理问题表达了担忧。这凸显出工作流程的演进不仅是技术挑战——它还涉及职业身份的转变以及对新素养的需求,而这些是任何自动化任务都无法衡量的。
在人机协作方面,OmniScientist认为真正的科学是一项社会性事业,共同演化的生态系统需要协作协议和同行评审等基础设施。尽管这更多是一种愿景而非实测结果,但它强调了共同演化涉及人类参与和知识网络,而这些在典型的智能体基准测试中是缺失的。因此,任务评估无法揭示共同演化工作流的全貌——既包括技术维度,也包括人类维度。
关于这些来源
本回答基于5项同行评审研究——发表于2025年至2026年,其中5项为2024年或之后——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的33篇文献。
本文引用的文献
Claw-Eval-Live:面向不断演化的真实世界工作流的实时智能体基准测试
Claw-Eval-Live是一个包含105项任务和13个前沿模型的实时基准测试,结果显示最佳模型仅通过了66.7%的任务,没有任何模型达到70%,失败主要集中在人力资源、管理以及多系统业务流程方面。
COMFYCLAW:面向图像生成工作流的自进化技能工具集
COMFYCLAW,一种面向图像生成工作流的技能进化框架,在所有六种智能体配置中均优于仅依赖验证器的基线,且人工标注者更倾向于选择它,这表明进化可复用技能能够提升可靠性。
协同演化的智能体架构与可解释推理在自动化优化中的应用
EvoOR-Agent是一个用于优化的协同进化框架,在案例研究和消融实验中表明,它通过进化工作流拓扑结构和推理轨迹,持续优于零样本大语言模型和固定流水线智能体。
生成式人工智能在应用艺术领域中的应用:工作流程变革、职业角色演变与新兴技能体系
一项针对十位应用艺术从业者的定性研究发现,生成式人工智能改变了工作流程和职业身份,参与者视AI为共同创作者,但也对同质化现象和伦理问题提出了担忧。
OmniScientist:迈向人类与AI科学家共同演化的生态系统
OmniScientist提出了一个用于共同进化人机科学生态系统的框架,包括协作协议和开放评估,但未报告定量结果。
