已被推翻的观点:原始潜在距离并非决策相关可达性的可靠代理指标
过去的假设是,如果潜在世界模型能很好地编码状态,那么按潜在空间中到目标的欧氏距离对候选计划排序就能奏效。这一假设如今已被直接推翻:在难度较高的TwoRoom基准测试中,潜在世界模型(LeWorldModel)采用原始潜在空间规划,成功率仅为7.0%,尽管XY位置可以从潜在空间以R²=0.998的精度线性解码[1]。通俗地说:模型“知道”智能体在哪里,但原始距离度量仍然错误地对候选计划排序,因为对可达性至关重要的维度在终端目标潜在MSE中占比不足1%[1]。
解决方案是用基于轨迹结构训练的轨迹可达性指标(TRM)来替代或增强原始潜在距离。采用该指标后,同一任务的成功率跃升至97.0%,而使用打乱时间标签的对照组仍为0.0%,这证明改进来自可达性信号,而非过拟合[1]。这一结果颠覆了“好的潜在表示自然会产生好的决策指标”这一观念——指标本身必须与规划目标对齐。
公平评估必须衡量什么:视界匹配的可达性、面向规划器的结果与闭环影响
首先,衡量该指标是否在与规划问题相同的时间跨度上训练。在TRM研究中,短时间跨度变体在相同的10万对预算下仅达到35.0%的成功率,而完整时间跨度版本达到了97.0%[1]。因此,公平的评估必须包含与时间跨度匹配的条件——否则,你可能会得出某个指标不佳的结论,而实际上它只是在不正确的时间尺度上训练所致。
第二,衡量该指标对规划器实际决策的影响,而不仅仅是预测误差。TRM研究使用了SCSA审计(一种检查排序和所选终点的方法),结果表明TRM同时改善了规划器选择的排序和终点[1]。在连续操作任务(PushT)中,TRM风格的任务状态指标在改善排序和所选最终距离方面比闭环成功率更清晰,这表明公平的评估应包含辅助混合成本,而不应仅依赖最终任务成功率[1]。
第三,衡量闭环性能以及开环与闭环之间的失配。自动驾驶的统一分类体系明确要求建立一套闭环指标集,并引入资源感知的决策成本,以缩小开环预测与闭环决策之间的差距[3]。这意味着,公平的评估应在规划实际发生的回路中测试指标,而不仅仅是在静态预测基准上进行。
公平的评估还必须考虑更多算力何时有帮助或适得其反——深度并非总是越好
对齐的另一个层面是,增加计算量(例如更深的展开)是否真正改善了与决策相关的预测。一项针对九个DeepMind控制任务的预注册研究发现存在三种情况:深度在6/9的任务中有帮助(展开误差最多提升8倍),在2/9的任务中有害(降至0.87倍),在其余任务中几乎无关紧要[5]。关键发现是:深度是否有帮助并非任务的固定属性,而是取决于运行配置——训练数据、度量空间、时间范围、编码器和骨干网络都会改变结果[5]。因此,对决策度量对齐的公平评估必须包含对这些配置因素的扫描,而不仅仅是单一的默认设置。
这与更广泛的观点相呼应:对齐并非一次性属性。同一项研究表明,仅基于维度的简单分类器就能在样本外预测该状态,这意味着一旦你了解配置,这种效应就是稳定且可预测的[5]。因此,为了公平评估,你应该报告配置,并测试该指标的对齐性是否在该配置下成立——否则,你可能会错误地将失败归因于指标,而实际上问题出在深度或计算资源上。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的35篇文献。
本文引用的文献
超越欧几里得邻近性:利用视界匹配的轨迹可达性度量修复潜在世界模型
在难度较高的TwoRoom基准测试中,原始潜在欧几里得规划的成功率仅为7.0%,尽管其XY解码能力近乎完美(R²=0.998);而与之匹配时间跨度的轨迹可达性指标(TRM)则达到了97.0%。在相同的配对预算下,短时间跨度的TRM变体仅达到35.0%,而打乱时间标签后的结果则为0.0%。
基于潜在世界模型的视频生成模型推理时物理对齐
在推理阶段使用潜在世界模型(VJEPA-2)作为奖励来引导视频生成,显著提升了多种场景下的物理合理性,并以62.64%的得分赢得ICCV 2025 PhysicsIQ挑战赛,比此前的最优结果高出7.42%。
自动驾驶的潜在世界模型:统一分类法、评估框架与开放挑战
自动驾驶中潜在世界模型的统一分类法识别出五种内部机制(包括结构同构与价值对齐目标),并提出了一套闭环指标体系和资源感知的推理成本,以缩小开环与闭环之间的差距。
UniZero:基于可扩展潜在世界模型的通用高效规划
UniZero是一种基于模块化Transformer的世界模型,能够联合预测潜在动态与面向决策的量,在长期记忆基准测试中优于基线模型,并在多任务Atari实验中展现出卓越的可扩展性,在单任务设置中达到或超越了当前最先进水平。
潜在世界模型中的自适应计算:深度何时有益、有害或无关紧要
一项预先注册的研究在九个DeepMind Control任务中发现,自适应计算深度存在三种模式:在6/9的任务中有帮助(滚动误差改善高达8倍),在2/9的任务中有害(降至0.87倍),其余任务则无显著变化;该模式可通过仅基于维度的冻结分类器进行预测,且取决于配置,而非固定的任务属性。
