“决策度量对齐”究竟是什么,为什么它如此重要?
在潜在世界模型中,模型学习环境的压缩表示,规划时通常利用该潜在空间中到目标的距离作为选择动作的成本。问题在于,模型可能很好地解码任务相关变量(如物体位置),但仍会错误地对候选动作序列进行排序——这意味着潜在距离并未反映真实的任务进展。这一差距正是[1]所称的决策度量对齐:即潜在成本是否以与真实任务成本相同的方式对动作进行排序。[1]表明,对任务变量的强解码并不能保证这种对齐,因此需要单独的诊断方法来检查这一点。
你如何证明对齐是真实的,而非仅仅是基准测试的产物?
关键在于直接用秩相关来衡量对齐程度。[1]提出了Plan-Real Spearman,它计算随机计划上潜在成本排序与实际成本排序之间的斯皮尔曼秩相关。他们还定义了CEM阶段斯皮尔曼,用于衡量交叉熵方法(CEM)搜索集中其提议时的一致性。这些指标提供了一种定量且与任务无关的方式,来判断潜在模型是否真正根据实际进展对动作进行排序。如果相关性高,则对齐是真实的;如果相关性低,则模型只是基准测试中的花招。
显式优化对齐是否真的能提升规划能力?
是的,而且证据是直接的。[1]在LeWM模型基础上增加了逆动力学和演示条件的目标-动作头(DA-LeWM),以显式改进用于欧氏成本、基于CEM的潜在模型预测控制的几何结构。在所有实验中,DA-LeWM加速了收敛,并在在线成功率上高于LeWM,而探针分数保持相似。这意味着改进并非来自更好的任务解码,而是来自更好的决策度量对齐。[2]同样表明,由观测到的未来和硬负样本监督的动作条件未来潜在表示,在NAVSIM-v1和NAVSIM-v2上达到了最先进的性能,验证了决策信息丰富的未来建模有助于规划。
是否存在因果证据表明潜在表征确实驱动了决策?
是的,[3]在一个经过训练以玩奥赛罗棋的简单Transformer中,提供了一个清晰的因果论证。他们发现,奥赛罗GPT封装了对手棋子的线性表征,并且这种表征在因果上引导了其决策过程。这一点很重要,因为它表明潜在表征不仅仅是被动的副产品——它主动影响了行动选择。尽管[3]属于玩具领域,但它通过展示潜在几何结构塑造决策这一底层机制是真实存在且可以被分离出来的,从而补充了[1]和[2]中更偏应用性的结果。
关于这些来源
此回答基于3项研究(均为预印本)——发表于2023年至2026年间,其中2项为2024年或之后发表——这些研究是从3项通过质量筛选的研究中选出的最相关者,而这些研究又源自从超过5亿篇论文的数据库中检索到的48篇文献。
本文引用的文献
潜在世界模型中的决策度量对齐:用于MPC规划的诊断与动作条件目标
引入Plan-Real Spearman和CEM-stage Spearman来衡量潜在–真实排名一致性,并表明添加动作条件头(DA-LeWM)可在保持探针分数相近的同时提升在线成功率和收敛性,表明其与决策指标的对齐更优。
DA-WAM:面向驾驶世界模型的决策对齐未来潜变量
提出DA-WAM,将预测性表征学习、动作条件下的未来建模与轨迹评分统一于单一决策目标之下,在NAVSIM-v1和NAVSIM-v2上取得了最先进的性能。
简单Transformer中的线性潜在世界模型:以Othello-GPT为例的案例研究
证明Othello-GPT学习了一种关于对立棋子的线性表征,这种表征因果性地引导其决策,为潜在表征能直接影响行为提供了证据。
