为何最终分数不足以评估长周期智能体
对于长周期AI研发智能体而言,单一的最终得分掩盖了进展的得失所在,也无法反映智能体是否真正遵循了用户的意图。2026年对七个前沿模型在36项长周期任务上的系统性评估发现,当前智能体的行为更像工程优化器而非自主研究者:其表现在不同运行间差异显著,且最强解决方案大多是对已有技术的改编或组合,而非产生真正的创新[5]。这意味着高分可能来自一次幸运的运行或巧妙的取巧,而非可靠、可信的行为。
同一项研究表明,相似的最终结果可能源于不同的流程瓶颈,而经验复用既可能有助于后续决策,也可能误导后续决策[5]。因此,仅评估最终结果,用户无从判断智能体是否正偏离既定目标,或是否正在做出日后会退化的决策。信任需要建立在对过程本身的可见性之上。
是什么让过程评估值得信赖:可审计的轨迹检查
信任的关键不仅在于孤立地检查每一步,更在于对照用户授权的任务,监控整个执行轨迹。2026年的一篇论文提出了“本体论信任”(ontological trust),这是轨迹前缀的一种属性,将信任分解为角色(Role)、目标(Goal)和证据(Evidence)三个维度(简称RGE)。该监控器仅使用大语言模型来生成结构化表示;信任状态的更新和干预决策都是确定性的,因此输出是一条可回放、可审计的信任轨迹,而非单一的评判结论[2]。在OSWorld、FinanceBench和EICU-AC上的测试中,RGE在检测前缀配对漂移方面优于基于规则、评判器和防护栏的基线方法,在每个基准上的漂移F1分数均超过93%,同时良性覆盖率保持在95.8%或以上[2]。
这对用户意味着:你可以清楚看到代理的信任级别在每一步变化的具体原因,并且可以重放评估过程加以验证。这与那些不透明的端到端评判形成鲜明对比——后者只给出一个结论,不做任何解释。信任更新的确定性至关重要——它使评估具有可复现性和可审计性,而这正是信任的基础。
基于诚信的解释建立恰当的信任
过程评估还必须传达智能体的诚信——即其诚实、透明和公正——以帮助用户校准其信任度。2023年一项涉及160名参与者的用户研究发现,明确披露其数据或算法中潜在偏差的AI智能体,比那些仅对能力保持诚实或对决策过程保持透明的智能体,更频繁地实现恰当的信任[4]。有趣的是,类似诚实的解释在错误发生后更有利于信任的恢复[4]。
这表明过程评估不应仅仅报告智能体做了什么,还应揭示其局限性和偏见。用户信任那些坦诚自身弱点而非只炫耀成功的智能体。这与2022年一项医学人工智能研究的发现一致,该研究显示,当系统提供有助于临床医生理解和交互的解释与功能时,91%的临床医生报告了积极的期望和满意度[1]。
用户感知与采纳取决于透明的过程信号
信任不仅仅关乎技术准确性,更在于用户如何感知并采纳智能体。2025年一项针对中国632名参与者的研究发现,信任将用户的双重决策路径(启发式与系统式)联系起来,从而驱动采纳行为[3]。这意味着用户既依赖快速印象,也依赖深入分析,因此流程评估必须兼顾这两方面。
对于长周期研发智能体而言,这意味着过程评估应同时提供高层信号(例如“智能体正在按计划推进”)和详细、可检查的日志(例如“每一步的证据如下”)。2026年评估框架[5]还强调了基于规则的指标的必要性,这些指标能够刻画运行过程中的行为,帮助用户不仅了解智能体做了什么,还能理解它是如何做到的。当用户能够看到过程并理解智能体的推理时,他们更有可能信任并采纳它。
关于这些来源
该回答基于5项研究(3篇经同行评审,2篇为预印本),发表于2022年至2026年间,其中3篇为2024年或之后发表,3篇发表于Q1期刊,累计被引用151次。这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇文献数据库中检索到的51篇论文。
本文引用的文献
BreastScreening-AI:评估医学智能代理在人机交互中的表现
在一项涉及九家机构45名临床医生的真实世界研究中,加入人工智能辅助使假阳性率降低了27%,假阴性率降低了4%,且91%的临床医生报告了积极的预期和满意度,这表明透明的解释和功能是建立信任的关键。
超越可疑步骤:长时程智能体中的本体论信任
提出了一种在线监控器(RGE),将信任分解为角色、目标和证据,并采用确定性更新以保证可审计性;在OSWorld、FinanceBench和EICU-AC上的前缀配对漂移检测中,其Drift F1超过93%,同时良性覆盖率保持在95.8%及以上。
消费者如何信任并接受AI智能体?一个扩展的理论框架与实证证据
基于对中国632名参与者的调查,信任在启发式与系统式决策路径与用户采纳AI智能体之间起中介作用,表明快速线索与详细信息对于建立信任均不可或缺。
基于诚信的解释,以促进对AI代理的适当信任
在一项涉及160名参与者的组间用户研究中,明确披露潜在数据偏差的AI代理比那些对能力坦诚或对决策过程透明的代理更常获得适度的信任,而类似诚实的解释有助于信任的恢复。
超越最终得分:面向长周期人工智能研发的智能体系统性评估
对七种前沿模型在36项长周期任务上的系统评估发现,最终得分掩盖了过程中的瓶颈和经验复用问题;智能体在不同运行间表现差异显著,且很少产生真正的创新,这凸显了引入过程层面指标的必要性。
