监管机构应如何评估物理AI闭环控制系统的相关声明?

监管机构如何验证闭环物理AI系统的控制力声明:测试协议、故障诊断及现实世界中的局限性。

直接答案

监管机构在评估闭环操控系统的声明时,应要求提供三方面的证据:系统能否自行诊断故障、能否在限定协议内修复故障,以及性能是否在可复现、可审计的条件下进行测量。相关论文表明,这类系统可以达到较高的成功率——例如在LIBERO-Pro上为90.8%,在RoboCasa上为93.6% [2]——但结果也在很大程度上取决于评估设置,其中一项研究在更难的测试套件上仅报告了65.98%的成功率 [1]。因此,监管机构在采信相关声明之前,应要求采用标准化基准、明确故障定义,并进行独立复现验证。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

变化何在:从开环到闭环的声明

此前,具身AI系统大多是开环的:它们在执行过程中遵循固定技能,仅在一轮任务结束后才进行反思。这意味着任务中的失败无法得到实时纠正。近期研究已转向闭环框架,能够在任务进行中诊断并修复失败。例如,Zetta采用三个时间尺度分离的循环,以高频控制动作,在轨迹层面提出批评-恢复计划,并仅在验证后更新技能[2]。这是一项根本性变革,因为它意味着系统能在任务中途适应调整,而不仅仅是在事后。

另一个关键转变是引入了明确的失败诊断与修复机制。Onto-EV-WM增加了一个基于本体的层,用于精确记录哪个任务谓词未得到满足、有哪些可用的修正路径,以及修正是否被接受[1]。类似地,Thea引入了“评估即退出代码”机制,以检测动作何时应终止、判断成功与否,并诊断失败原因[3]。监管机构应关注这类明确且可审计的失败处理组件,而不仅仅是整体成功率。

监管者应要求何种证据?

首先,他们应当要求采用标准化、可复现的基准测试。相关论文表明,性能随任务套件的不同而差异显著:Onto-EV-WM在包含10,030个任务的注册表上总体准确率达到85%,但在LIBERO-10子集上仅为65.98%[1]。若不明确具体任务、模拟器和评估协议,声称“94%的成功率”便毫无意义。监管机构应强制要求,任何性能声明必须与定义明确的基准测试及其清晰的成功标准挂钩。

第二,他们应要求提供失败诊断与修复的证据,而不仅仅是最终的成功。这些论文强调,闭环框架必须能够识别任务失败的原因并应用修正。例如,Onto-EV-WM会保留缺失的谓词及其参数,从而实现有针对性的修复[1]。监管机构应要求提供日志或追踪记录,以显示系统检测到失败、选择了修正路径并验证了修正效果——而不仅仅是任务最终成功的结果。

第三,他们应要求具备可审计、可追溯的测量手段。MMRHP提供了一套与预期功能安全(SOTIF)标准相衔接的结构化三阶段测试流程,并以统一的时空测量核心来确保物理运动与系统时序的一致且可追溯的量化[4]。监管机构应寻求类似的严谨性:明确界定何为成功、如何测量时序,以及如何追踪物理运动。若缺乏这些,相关主张便无法在科学上实现可复现。

有哪些局限性和注意事项?

证据主要来自仿真,而非真实机器人。Onto-EV-WM明确表示未评估真实机器人的恢复能力[1]。Zetta报告的结果基于LIBERO-Pro和RoboCasa,这些均为仿真基准[2]。监管机构应将仿真结果视为有前景但不足以支撑实际部署,尤其是在自动驾驶等安全关键领域——MMRHP发现,在注入40毫秒延迟时会出现“性能悬崖”[4]

另一个需要注意的问题是,由于任务套件和评估协议不同,部分报告的成功率在不同论文之间并不直接可比。例如,Zetta在LIBERO-Pro上报告了90.8%的成功率[2],而Onto-EV-WM在LIBERO-Goal上报告了91.39%[1]——但这两者属于不同的基准测试,因此无法据此判断哪个系统更优。监管机构在做出决策前,应要求各方在相同基准上进行直接对比。

最后,这些论文并未提供关于长期可靠性、安全性或伦理影响的证据。城市自动化框架[5]提出了关于机构问责制和民主合法性的担忧,而这些在技术论文中并未得到解决。监管机构应考虑这些更广泛的影响,尤其是对于将在公共空间运行的系统。

关于这些来源

本回答基于5项同行评审研究——发表于2025年至2026年,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的72篇文献。

本文引用的文献

1

基于本体论的世界模型,用于物理AI系统中的故障诊断与闭环修复

Onto-EV-WM,一种基于本体论的诊断与验证门控修正接口,在包含10,030个任务的注册表上实现了85%的成功率,在LIBERO-10上达到65.98%,在LIBERO-Goal上达到91.39%,但未对真实机器人恢复能力进行评估。

2

Zetta $\zeta$:一种用于自进化物理智能的高效闭环具身操控系统

Zetta是一种具有三个时间尺度分离回路的闭环具身智能框架,在LIBERO-Pro上取得了90.8%的成功率,在RoboCasa上取得了93.6%的成功率,推理速度提升了11.1倍,且技能实现了零样本迁移。

3

迈向具身智能体的驾驭之道

Thea,一个面向具身智能体的控制框架,引入场景图作为上下文,并以退出码作为评估机制,从而在智能体与物理世界之间形成闭环,使其能够在真实环境中执行长时程任务。

4

MMRHP:一种用于可审计闭环评估的微型混合现实硬件在环平台

MMRHP是一个微型混合现实硬件在环测试平台,提供了一套与SOTIF(预期功能安全)对齐的三阶段结构化测试流程。在Autoware案例研究中,该平台实现了10.27毫米的RMSE空间精度,并识别出在40毫秒注入延迟时出现的性能悬崖。

5

从优化到闭环城市自动化:AI–IoT赋能智慧城市中空间智能与物理AI的概念框架

面向闭环城市自动化的概念框架将其与以优化为中心的模型区分开来,并提出六项主张,强调在AI-IoT赋能的智慧城市中,制度问责与民主合法性的必要性。