[CVPR 2025] Solaris:多人协作世界模型,重塑 Minecraft 视觉模拟
Solaris: Building a Multiplayer Video World Model in Minecraft
本文推出了 Solaris,这是首个能够在 Minecraft 场景中模拟一致性多视角观察的多人视频世界模型(Multiplayer Video World Model)。通过构建 SolarisEngine 自动化数据采集系统和分阶段训练流程,该模型成功实现了多人动作条件下的视频生成,并在视角一致性和长程预测稳定性上达到了 SOTA 水平。
TL;DR
纽约大学 Saining Xie 团队近日发布了 Solaris —— 这是首个专为 Minecraft 打造的多人视频世界模型。不同于以往只能“看自己”的模型,Solaris 能同时模拟多个玩家的视角,并确保他们在同一个物理世界中的动作高度一致。假如玩家 A 盖了一座塔,玩家 B 的视角里会同步出现这座塔。该工作开源了包含 1264 万帧的多人动作标注数据集,并提出了一种极低显存消耗的 Checkpointed Self Forcing 训练技术。
背景定位:从“单机”到“联机”的世界模型
世界模型(World Models)是具身智能学习的核心。虽然单人视频生成(如 Open AI 的 Sora 或 Google 的 Genie)已经非常惊艳,但在真实物理世界中,多智能体互动才是常态。Solaris 的出现填补了这一空白,它不仅是一个视频生成器,更像是一个基于神经网络的“多人游戏引擎”。
痛点与动机:为什么多人视角建模这么难?
- 视角一致性 (View Consistency):如果两个玩家面对面,玩家 A 向左移动,在玩家 B 看来应该是向右。这种空间变换的逻辑要求模型具备极强的 3D 几何常识。
- 物理同步 (Action Grounding):一个玩家对环境的修改(如挖矿、战斗)必须实时反映在所有人的视野中。
- 自回归崩坏 (Autoregressive Drift):长程视频生成往往会随着帧数增加而变得模糊或逻辑混乱。
核心方法:Solaris 的架构与创新
1. 多人 DiT 架构
Solaris 改造了原有的单人 Diffusion Transformer (DiT)。它将不同玩家的图像 Token 在序列维度上进行交错(Interleaving),并通过交叉玩家的自注意力层(Multiplayer Self-Attention)让 Token 知道“队友正在干什么”。
图 5:Solaris 的多人 DiT 块设计,通过 Interleaving 实现多玩家信息的实时交换。
2. Checkpointed Self Forcing:长程生成的显存救星
传统的 Self Forcing(自强化训练)通过让模型观察自己的错误输出进行修正。但在多人滑动窗口生成时,显存消耗会爆炸。 作者引入了类比于梯度检查点(Gradient Checkpointing)的思路:
- Rollout 阶段:仅前向计算视频,缓存中间混淆帧,不存梯度。
- Recomputation 阶段:利用一个特殊的 Teacher Forcing Mask,在一次并行前向传递中重构所有帧的去噪过程。 这种设计将显存复杂度从平方级降低到了线性级,使得训练长达数百帧的一致性视频成为可能。
实验与结果:全方位碾压基线
研究团队设计了一套“VLM-as-a-Judge”的评测体系。他们不仅计算视觉质量(FID),还让大模型(VLM)去判断:
- 移动一致性:玩家移动方向是否正确?
- 空间记忆:转头再转回来,那个玩家还在原位吗?
- 建筑验证:玩家盖的房子在队友视角里出现了吗?
表 2:Solaris 在各项多人评估指标中均显著超过基线方案(如简单的 Frame Concat)。
深度洞察:学到了什么?
Solaris 不仅仅学会了画图,它还展现出了令人惊讶的隐式推理能力:
- Inventory Tracking:能够感知方块放置后物品栏的数字减少。
- Global Events:同步模拟天气的突变(如下雨)。
- Complex Interactions:流畅模拟 PvP 战斗及物品切换动画。
图 10:Solaris 展现的物品栏同步、环境一致性及战斗模拟能力。
局限性与展望
尽管 Solaris 在 Minecraft 中表现出色,但它目前主要依赖合成数据,且缺乏真正的“长期持久记忆”(当玩家离开视野太久,环境可能会发生不可控的漂移)。 未来的研究方向将集中在如何将这种多人模拟能力迁移到真实世界的自动驾驶及协作机器人场景中。
总结
Solaris 的开源(包括代码、数据集和模型权重)为后续的多智能体研究奠定了重要基础。它证明了:只要通过合理的架构调整与显存优化,生成式模型完全可以胜任复杂、多人、动态世界模型的构建任务。
