为何测试时计算是安全部署前测试的关键
机器人基础模型能力强大,但依赖数据驱动,因此在面对真实人类时可能以意想不到的方式失效。核心权衡在于模型学到的灵活性与形式化安全保证需求之间的张力。测试时计算——即在推理阶段投入额外算力——提供了一种无需重新训练模型即可弥合这一差距的途径。[1]表明,通过逐步优化模型的行动分布,可以在不修改参数的情况下强制执行诸如时间有界目标和持续安全条件等安全约束。[3]证明,在推理时将快速学习策略与基于物理的慢速校验器相融合,可将导航中的失败率降低多达4倍,同时保持目标达成性能不变。这意味着你可以在让模型接触人类之前,先在仿真环境中用这些安全层对其进行测试。
测试什么:不确定性、风险与暂停能力
一个安全的机器人必须知道自己何时不知道。[2]表明,在五个结直肠癌病理数据集上,不确定性感知的测试时自适应提高了准确性和校准度,并生成了可解释的不确定性图,以支持人机协作。虽然那是一个医学影像场景,但这一原则可以迁移:一个能标记自身不确定性的机器人部署起来更安全。[3]采用风险引导的方法,利用基于物理的“系统二”来检查学到的“系统一”策略,这在火星等极端环境中尤为重要。[4]进一步指出,分层模型可以在测试时按需搜索替代子任务选择,从而提高长时程任务中的下一子任务预测准确率和闭环成功率。因此,你的测试应包含迫使模型面对不确定性和风险的场景,并且你应验证它能否避免不安全行为或主动寻求帮助。
如何测试:在仿真中扩展计算规模,并检验计算最优行为
测试应包括在仿真中扩展测试时计算量,以观察模型在获得更多思考时间后是否有所改进。[4]表明,在长时程操作任务中,分配额外的测试时计算能显著提升子任务预测和闭环成功率。[5]引入了SWIFT框架,用于扩展世界基础模型的测试时计算,证明测试时缩放定律成立,并且存在一种计算最优的方式——也就是说,你可以找到额外计算带来最大收益的最佳平衡点。[1]在多个环境和复杂规格下于仿真中验证了其安全框架。因此,你的测试方案应包括在仿真中以不同的计算预算运行模型,同时衡量安全性和任务成功率,并确定能在性能与风险之间取得平衡的计算水平。
关于这些来源
本回答基于5项同行评审研究——发表于2025年至2026年,其中5项为2024年或之后——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的47篇文献。
本文引用的文献
面向机器人基础模型的规格感知分布塑造
提出了一种考虑规范的动作分布优化方法,在不修改参数的情况下,于预训练机器人基础模型执行过程中强制执行信号时序逻辑约束,并在多种环境及复杂规范下进行了仿真验证。
面向不确定性与因果推断的测试时自适应基础模型,用于稳健的结直肠癌病理诊断
提出UAD-FM,一种具有不确定性感知与因果自适应能力的基础模型,在五个公开的结直肠癌数据集上提升了准确性、校准性和领域鲁棒性,并生成可解释的不确定性图谱,以支持人机协作。
风险引导扩散:迈向在太空中部署机器人基础模型——在那里,失败不容选择
提出了一种风险引导的扩散框架,将快速学习策略与慢速物理基检查器相融合,在NASA喷气推进实验室火星试验场中,将导航失败率降低多达4倍,同时保持目标到达性能不变。
$\tau_0$-VLA:一种具有世界模型引导的测试时计算的分层机器人基础模型
本文介绍了τ0-VLA,一种具有世界模型引导的测试时计算的分层机器人基础模型,表明在长时程操作任务中,分配额外的测试时计算可显著提升下一子任务预测能力和闭环成功率。
测试时扩展能否提升世界基础模型?
本文介绍了SWIFT——一个面向世界基础模型的测试时扩展框架,证明了测试时扩展定律成立,并且计算最优的扩展方式能够在无需重新训练或增大模型规模的情况下提升推理性能。
