[ICML 2025] PERSIST:让世界模型拥有持久化 3D 内存,突破视频生成的时空一致性极限

Beyond Pixel Histories: World Models with Persistent 3D State

总结
问题
方法
结果
要点
摘要

本文提出了 PERSIST 框架,这是一种新型的交互式世界模型。它改变了以往基于像素历史的生成范式,通过引入一个显式的、动态演化的持久化 3D 隐空间状态(World-Frame)来模拟环境。该模型在 3D 一致性和长程生成稳定性方面达到了 SOTA 水平,并在 FVD 指标上相比基线模型显著降低了约 70%。

TL;DR

传统的视频生成模型往往是“近视”的——它们只盯着过去几秒钟的像素看。当你在虚拟世界里转了一圈回到原点,模型通常已经忘记了背后长什么样。PERSIST (Persistent Environment Representations for Simulating Interactive Space-Time) 彻底改变了这一点:它不再通过像素,而是通过维护一个动态生成的 3D Voxel(体素)网格来模拟世界。这使得模型在处理长程探索任务时,具有前所未有的 3D 几何一致性和“空间记忆”。

痛点深挖:为什么像素历史是不够的?

目前的交互式世界模型(如 OasisMatrix-Game)大多走的是 Auto-regressive (AR) 扩散路线。它们的逻辑是:“根据过去 帧画面和动作,预测下一帧。”

这种方法存在两个本质缺陷:

  1. 内存瓶颈:受限于 GPU 显存,模型能“看”到的历史非常短。通过像素检索(Key-frame Retrieval)虽然能缓解,但像素是视角相关的。
  2. 几何模糊:像素只是 3D 世界的 2D 投影。模型必须在缺乏显式几何知识的情况下,“盲猜”物体的空间关系,导致场景在快速移动时经常发生物体扭曲或坍塌。

方法论详解:解耦 3D 状态、相机与渲染

PERSIST 的核心 Insight 是:像游戏引擎一样思考。 它不再把像素当作记忆,而是构建了一个持久演化的 Latent 3D State。

1. 架构三剑客

  • World-Frame Model ():它是模型的大脑。它预测 3D 体素格如何随着玩家的动作(Action)而改变。即使某个物体跑到屏幕外了,它的 3D 状态依然在体素格中被持续追踪。
  • Camera Model ():就像一个摄影师,根据动作精确计算相机在 3D 环境中的位姿。
  • World-to-Pixel Generator ():这是一个基于神经网络的渲染器。它通过**可微投影(Differentiable Projection)**将 3D 状态投影到当前相机的平面上,形成深度有序的特征栈,最后生成照片级的像素输出。

模型架构图

2. 几何驱动的投影机制

为了让像素生成器感知空间,作者使用了**神经延迟着色(Neural Deferred Shading)**技术。通过将 3D Voxel 特征投影为多层的 特征图,模型在生成每一帧时都有明确的“深度提示”,从而保证了运动视差(Motion Parallax)的绝对正确。

实验与结果:断层式领先的 SOTA

作者在高度复杂的 Minecraft 式环境 Luanti 中进行了大规模实验,使用了超过 460 小时的交互数据进行训练。

1. 关键指标对比

在 FVD (Frechet Video Distance) 指标上,PERSIST 取得了惊人的提升:

  • Oasis: 706
  • WorldMem: 596
  • PERSIST-XL: 181 (降低了约 75%)

2. 人类视角:3D 与时间一致性

在超过 800 次的人类评测中,PERSIST 在“3D 一致性”和“环境稳定性”上的得分几乎是基线模型的两倍。这意味着当玩家在世界中反复绕圈、回头、重新进入山洞时,场景基本保持不变,而基线模型通常会生成一个完全不同的地形。

实验结果对比

深度洞察:超越生成的“编辑”能力

由于 PERSIST 内部维护了一个显式的 3D 表征,它展现了一些非常酷的新能力:

  • 单图直入 3D:只需给模型一张 RGB 图片,它能自动补全并生成该图片对应的 3D 体素世界。
  • 中途实时编辑:你可以随时“暂停”世界模型,在 3D 空间里加一棵树或挖一个洞,模型能在接下来的视频生成中完美融合这个修改。
  • 幕后模拟:模型能够模拟发生在视野外的事件(Off-screen Dynamics)。例如,在你看不见的地方,水正在从山上流下来,直到它流进你的视野,这种逻辑连贯性是纯视觉模型无法企及的。

世界编辑示例

总结与局限

PERSIST 的成功标志着世界模型从“像素模拟”向“几何模拟”的重大跨越。虽然它目前仍依赖模拟器的 3D 地面真值进行监督训练(这也是未来需要克服的难点),但它为我们描绘了一个充满可能的未来:

  • 训练机器人:在无需硬编码物理引擎的情况下,为具身智能体提供更真实的仿真环境。
  • 即时游戏创作:通过自然语言或简单涂鸦,生成可以真正探索、修改并保持一致的持久宇宙。

尽管目前的 AR 架构仍面临一定的曝光偏差(Exposure Bias)导致的长程漂移,但这种 3D 持久化表征已经显示出了极强的纠错和稳定效果,让生成的视频生命力从几秒钟跃升到了数分钟。

发现相似论文

试试这些示例

  • 查找其他在生成式视频模型中引入显式几何约束或类似延迟着色 (Deferred Shading) 机制的最新研究。
  • 哪篇论文最早在 Transformer 架构中实现了 3D Voxel 状态的自回归演化,本文在时空注意力机制上做了哪些具体改进?
  • 有哪些研究正在探索如何在没有地面真值 (Ground-truth) 3D 数据的情况下,通过 2D-to-3D 预训练模型为 PERSIST 这种架构提供无监督训练信号?
目录
[ICML 2025] PERSIST:让世界模型拥有持久化 3D 内存,突破视频生成的时空一致性极限
1. TL;DR
2. 痛点深挖:为什么像素历史是不够的?
3. 方法论详解:解耦 3D 状态、相机与渲染
3.1. 1. 架构三剑客
3.2. 2. 几何驱动的投影机制
4. 实验与结果:断层式领先的 SOTA
4.1. 1. 关键指标对比
4.2. 2. 人类视角:3D 与时间一致性
5. 深度洞察:超越生成的“编辑”能力
6. 总结与局限