为何实时修正对长任务至关重要
闭环数据采集系统之所以能够避免重复犯错,主要在于它们能在任务进行中及时纠正错误,而非等到任务结束后才进行修正。Zetta作为一套闭环具身智能系统,通过三个时间尺度分离的控制回路,以高频执行动作、在 rollout 过程中提出基于评论家的恢复技能,并在采纳技能更新前进行验证 [1]。这意味着系统能够立即捕捉到错误动作并加以调整,而无需等到整个回合结束才进行反思。在测试中,Zetta在LIBERO-Pro基准上取得了90.8%的成功率,在RoboCasa基准上达到了93.6%,这两项基准均涉及长序列、多步骤的操作任务 [1]。这些数据表明,与仅在事后进行反思的开环系统相比,实时纠错显著提升了系统的可靠性。
物理与因果在规划中的作用
另一个关键部分是让操控系统具备对物理和因果关系的先天理解,从而能在行动之前模拟其后果。闭环多步规划框架正是为此而设计:它定义了称为“任务”的临时闭环控制器,以及一个监督性的“配置器”,后者利用物理引擎模拟任务序列,并将结果存储到环境模型中[2][3]。这使得机器人能够通过串联依赖于感官输入的任务来进行规划,并通过预测接下来会发生什么来避免错误。该框架已在真实机器人上实现,并在超车场景中进行了测试,证明这种方法在实践中行之有效[3]。结合Zetta的实时校正,这两种方法——反应式校正与预测性模拟——相辅相成,共同应对长时程可靠性的挑战。
证据尚未揭示的内容
尽管研究结果令人鼓舞,但仍存在一些重要的注意事项。Zetta的成功是在特定的部署预算和冻结的基础策略下实现的,这意味着其“护栏”系统(harness)会进化其评判者和恢复技能,但不会改变底层策略[1]。这引发了疑问:该方法能否扩展到更复杂的任务,或基础策略本身存在缺陷的任务?闭环多步规划框架仅在两种场景(超车和另一个概念验证)中进行了测试,因此其泛化能力仍属未知[2][3]。此外,两篇论文均未报告所学技能的长期保持情况,也未涉及数百步任务的性能,因此我们尚无法判断这些系统能否长期避免错误。现有证据强烈表明,闭环“护栏”系统是向前迈出的一步,但该领域仍处于早期阶段,需要在多样化、更长的任务上进行更多测试。
关于这些来源
此回答基于3项研究(均为预印本)——发表于2024年至2026年间,其中3项为2024年或之后发表——这些研究是从3项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的51篇文献。
本文引用的文献
Zetta ζ:一种用于自进化物理智能的高效闭环具身驾驭系统
Zetta是一种闭环具身智能框架,通过在线演化运行时评判器与恢复技能,在保持基础策略冻结的情况下,在LIBERO-Pro上取得了90.8%的成功率,在RoboCasa上达到了93.6%,同时实现了11.1倍的推理加速以及所学技能的零样本迁移。
闭环多步规划
闭环多步规划框架定义了临时闭环控制器(“任务”)以及一个具备固有物理和因果知识的监督模块,从而通过任务链式组合实现规划;该框架已在真实机器人上实现,并在两个场景中进行了概念验证测试。
具备先天物理知识的闭环多步规划
基于物理引擎的配置器所构建的分层框架已在真实机器人上实现,并在超车场景中进行了测试,结果表明,具备内在物理知识的闭环多步规划在实际应用中切实可行。
