真正的瓶颈在于规划器的目标,而非世界模型的预测精度
长期以来,人们一直认为,如果潜在世界模型在长时程任务中表现不佳,那是因为模型的预测随时间推移而逐渐变差。但2026年的一项研究颠覆了这一观点:在对LeWorldModel于双房间环境中的复现实验中,预测器在75步之后依然准确——其想象状态的误差仅为假设世界静止时误差的0.189——然而规划器从未想象超过25步[1]。问题出在用于规划的损失函数上:它最小化潜在空间中的平方距离,而该距离对真实距离的追踪效果很差(相关系数r=0.426),甚至在超过120个单位后还会下降,导致远离目标反而可能降低损失[1]。信息其实全都存在——一个探针可以从冻结的嵌入中恢复位置,R²=0.9922——但规划器的目标函数却无法利用这些信息[1]。
修复效果显著:仅替换目标函数,无需重新训练,也不依赖GPU,便将100步偏移下的目标达成率从26.0%提升至98.0%,与25步偏移下的98.0%持平;甚至在计算预算缩减至三分之一时,仍能达到92.0%[1]。这表明规划器的目标函数是制约瓶颈,而将其与真实任务目标对齐即可消除对时间跨度的依赖。研究还发现,仅通过帧分离学习得到的头部表征,其预测空间距离的能力虽不如位置探针(r=0.819对0.9897),但规划效果却更优——在穿越墙壁时,前者额外收取24%的代价,而后者基于平方潜在距离仅少收4%——原因在于前者学到的是可达性,而非单纯的邻近性[1]。
联合学习动作与前瞻,并融入结构化知识,有助于使度量指标与控制目标对齐
实现对齐的另一条路径是联合训练世界模型与策略,使潜在表征由控制表现而非单纯预测来塑造。2026年的视觉导航模型WAM-Nav采用共享扩散Transformer,同时生成长时程动作与短时程视觉预演,从而减少自回归展开带来的误差累积[2]。该方法在图像目标导航上较强基线提升了15.7%的成功率,在点目标导航上提升了3.3%,并在真实世界零样本迁移中达到85%的任务成功率[2]。关键在于,模型学会想象对行动至关重要的内容,而不仅仅是预测像素。
同样地,KG-M3PO作为一个2026年的多任务操作框架,通过在线3D场景图增强自我中心视觉,并利用强化学习目标端到端训练图神经编码器,从而使关系特征直接由控制性能塑造[4]。这种知识条件化的智能体在成功率、样本效率以及对新物体和新场景的泛化能力上始终优于基线方法[4]。这两项研究汇聚于同一原则:当学习到的表征与控制目标对齐时,长时程行为会变得更加稳健。与[1]的对比具有启发性:[1]表明,即使拥有良好的世界模型,目标不对齐也会破坏规划;而[2]和[4]则显示,将学习过程本身与控制目标对齐能带来性能提升。
可扩展性与可信度:对齐有帮助,但并非万能灵药
证据还表明,对齐决策指标可以提升可扩展性。UniZero是一种2024年提出的类MuZero算法,采用基于模块化Transformer的世界模型,联合预测潜在动态与决策导向量,在需要长期记忆的基准测试中优于基线方法,并在多任务Atari实验中展现出更优的可扩展性[3]。这支持了这样一种观点:将世界模型的预测与决策相关量(如价值与策略)对齐,有助于提升其在多样化任务中的表现。
然而,一项2026年关于可信智能体AI的调查警告称,多步轨迹引入了新的失效模式,对可信性构成挑战,例如约束违反和对抗性攻击[5]。该调查强调需要运行时监控与验证,并指出结果信号和过程信号(如轨迹完整性)对部署至关重要[5]。因此,尽管对齐决策指标可以防止许多重复性错误,但在高风险环境中,这并不能保证安全性或鲁棒性。该调查呼吁采取分阶段、有针对性的缓解措施,这表明对齐是必要的但并非充分条件——你还需要监控和验证,以捕捉那些漏网之鱼式的失效。
关于这些来源
本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的65篇文献。
本文引用的文献
目标即瓶颈:潜在世界模型编码了其规划器无法使用的内容
在TwoRoom上复现LeWorldModel时,瓶颈在于规划器的目标函数——而非预测器:仅替换目标函数,无需重新训练,即可将偏移100处的目标达成率从26.0%提升至98.0%,与短视界表现持平。
WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模
WAM-Nav是一种用于视觉导航的潜在世界-动作模型,它联合学习动作生成与短时视觉预判,在图像目标导航上相比基线方法成功率提升15.7%,在点目标导航上提升3.3%,并在真实世界任务中达到85%的成功率。
UniZero:基于可扩展潜在世界模型的通用高效规划
UniZero是一种基于模块化Transformer的世界模型,能够联合预测潜在动态与面向决策的量,在长期记忆基准测试中优于基线模型,并在多任务Atari实验中展现出卓越的可扩展性。
基于知识引导的多任务强化学习操控
KG-M3PO是一种基于知识图谱的多任务强化学习框架,通过强化学习目标端到端地训练图神经编码器,在操作任务中于成功率、样本效率以及对新物体和新场景的泛化能力方面均取得了持续提升。
迈向可信赖的智能体AI:安全性、鲁棒性、隐私与系统安全的综合综述
一项关于可信智能体AI的2026年调查识别出多步轨迹中的新型失效模式,并强调在安全部署中需要运行时监控、验证以及诸如轨迹完整性之类的过程信号。
