为何监管者应关注过程,而非仅看最终代码
监管机构在评估面向AI软件开发者的开放平台时,不应仅仅检查智能体是否生成了正确的代码。2025年一项针对8个排名靠前的智能体在500个GitHub问题上的3977条求解阶段轨迹的研究发现,解决阶段中的Python执行错误与较低的解决率及更高的推理开销相关[1]。简而言之:如果智能体在早期就出错,它往往失败更多、消耗更多算力,因此过程与结果同样重要。
同一项研究还指出了最常见的错误类型——ModuleNotFoundError和TypeError——并特别强调了诸如OSError以及与数据库相关的问题(如IntegrityError)等尤为棘手的错误,这些错误需要投入多得多的调试精力[1]。对监管者而言,这意味着智能体能否妥善处理错误,是衡量其可靠性的一个关键指标。此外,该研究还在SWE-Bench平台本身发现了3个影响基准测试公平性和准确性的缺陷[1]。这是一个具体的警示:即便是广泛使用的基准测试也可能存在缺陷,因此监管者在依赖任何评估工具之前,都应先核实其完整性。
如何通过可见性与合规性设计确保问责制
监管机构需要了解AI智能体在何处、为何、如何以及被何人使用——治理研究者称之为“可见性”[3]。一篇2024年关于AI智能体治理的论文概述了三类措施:智能体标识符、实时监控和活动日志,每类措施的实施方式在侵入性和信息量上各有不同[3]。对于开放平台而言,这意味着要求对智能体的行为和决策进行详细记录,从而支持问责与审计。
在金融和医疗等合规要求严格的领域,2024年的一项安全AI智能体框架强调了三大支柱:具备上下文感知的细粒度访问控制、持续监控与审计,以及可解释的决策路径[6]。该论文的初步评估表明,这一架构在降低合规违规的同时保持了运行效率[6]。对监管者而言,这意味着开放平台应从设计之初就融入这些支柱,而非事后补救。2023年的一套法律AI系统还采用了人在回路控制机制作为最终保障,以确保准确性并降低风险[7],这为高风险场景中的监督提供了一个切实可行的模式。
监管机构应如何要求开放平台提供评估声明
开放平台常常标榜其在SWE-Bench等基准测试上的表现,但监管机构应审视这些基准测试的构建和维护方式。2025年的一项研究发现SWE-Bench中存在3个影响公平性和准确性的漏洞,且已得到维护者确认[1]。这表明即便是流行的基准测试也可能存在缺陷,因此监管机构应要求平台公开基准测试版本、已知问题及结果计算方式的透明度。
像OpenHands和ToolUniverse这样的开放平台,通过整合基准测试并标准化工具交互,为评估提供了基础[2][4]。例如,OpenHands以MIT许可证发布,拥有来自188位贡献者的超过2100项贡献,体现了社区驱动的特点[2]。ToolUniverse则标准化了AI科学家识别和调用工具的方式,并将该标准应用于超过2700种科学工具和130多项研究技能[4]。对监管者而言,这种开放性是一把双刃剑:它既支持独立审计,也意味着相关声明必须对照实际代码和数据加以验证。2025年推出的LLM路由器比较平台RouterArena,为标准化排行榜提供了范例,支持自动更新[5],这一模式或可借鉴用于智能体评估。
关于这些来源
本回答基于7项研究(4项经同行评审,3项为预印本),发表于2023年至2025年间,其中6项为2024年或之后发表,合计被引用443次。这些研究是从8项通过质量筛选的研究中选出的最相关者,而这8项研究又源自从超过5亿篇论文数据库中检索到的49篇文献。
本文引用的文献
超越最终代码:面向过程的软件开发生成代理在真实GitHub场景中的错误分析
分析了8个智能体在500个GitHub问题上的3,977条解决阶段轨迹和3,931条测试阶段日志,发现Python执行错误与较低的解决率及更高的推理开销相关,并揭示了SWE-Bench中影响公平性的3个缺陷。
OpenHands:一个面向AI软件开发者的开放平台,助力通用型智能体
介绍了OpenHands——一个面向AI软件开发者的开放平台,该平台已获得188位贡献者的超过2100项贡献,并在包括SWE-Bench和WebArena在内的15项任务上对智能体进行了评估。
对AI智能体的可见性
提出了三类针对AI代理的可见性度量措施——代理标识符、实时监控和活动日志——并分析了它们在集中式和去中心化部署场景中的实施情况。
ToolUniverse:一个推动AI科学家民主化的开放平台
我们推出了ToolUniverse,这是一个开放平台,为AI科学家标准化工具交互,将其标准应用于超过2700个科学工具和130项研究技能,并通过三个案例研究展示了端到端的分析流程。
RouterArena:一个用于全面比较LLM路由器的开放平台
推出了RouterArena——首个用于比较LLM路由器的开放平台,其数据集涵盖广泛的知识领域和难度等级,并配备自动化排行榜框架。
为合规/监管关键环境中的自主数据访问构建安全AI代理
提出了一种面向合规关键环境中AI智能体的安全架构框架,强调细粒度访问控制、持续监控和可解释决策,初步评估显示合规违规行为有所减少。
Gracenote.ai:面向监管合规的法律生成式人工智能
开发了面向监管合规的法律生成式AI工具,采用GPT-4与人在回路控制以减少幻觉,并强调了LLM作为专业工具基础引擎的作用。
