[DreamWorld] 统一世界建模:视频生成从“像素级幻觉”迈向“物理级模拟”
DreamWorld: Unified World Modeling in Video Generation
本文提出了 DreamWorld,这是一个统一的视频生成框架,通过“联合世界建模范式”(Joint World Modeling Paradigm)将语义、几何和动态等多源异构知识集成到视频生成模型中,在 VBench 2.0 和 WorldScore 等多个基准测试上超越了 Wan2.1 等 SOTA 模型。
TL;DR
尽管视频生成领域在视觉保真度上取得了飞跃,但模型往往缺乏对世界运作规律的深刻理解。本文提出的 DreamWorld 框架,通过 Joint World Modeling Paradigm 成功将语义、空间几何、时间动态三种维度的专家知识整合进入 DiT 架构。相比 Wan2.1,它在 VBench 2.0 上的表现提升了 2.26 分,并在物理一致性测试中展现了极强的鲁棒性,成为了迈向通用世界模型的重要一步。
核心挑战:视频生成不等于“懂世界”
目前的 SOTA 模型如 Sora、Wan2.1 在电影级画质上难寻对手,但它们本质上是“像素分布匹配器”。一旦涉及复杂的物理交互(如液体倾倒、物体遮挡、人体解剖学一致性),这些模型常会产生违背物理常识的“幻觉”。
以往的研究(如 VideoREPA)尝试通过对齐单一专家模型(Expert Model)来注入知识,但这种方法在面对物理规律(光流)、空间结构(VGGT)和高层语义(DINOv2)等多重异构目标时,会陷入 多目标优化冲突:不同的梯度方向会导致训练不稳定,甚至出现画面高频闪烁。
创新方法论:联合世界建模与约束退火
1. 联合世界建模范式 (Joint World Modeling)
DreamWorld 不再仅仅将外部知识视为条件,而是将它们视为预测目标。
- 异构特征集成:利用 RAFT 提取光流、VGGT 捕捉几何、DINOv2 提取语义。
- 架构扩展:通过扩展 DiT 的线性投影层 ,将视频 Latent 与这些世界知识特征拼接。通过将初始权重设为零,确保了预训练模型能力的平滑迁移。
图 1:DreamWorld 训练与推理流程图。训练阶段联合预测视频像素与世界特征,推理阶段利用 Inner-Guidance 进行校准。
2. 一致性约束退火 (CCA)
为了解决强制物理约束带来的画质受损问题,作者提出了 Consistent Constraint Annealing (CCA)。
- 逻辑直觉:在训练初期,模型需要强力的物理引导来学习世界结构;但在后期,为了追求像素级的极致细腻和无伪影,需要逐渐减弱这些强制约束。
- 公式体现:。这种余弦退火策略确保了物理逻辑与生成美感之间的优雅平衡。
3. 多源内部引导 (Multi-Source Inner-Guidance)
在推理阶段,DreamWorld 利用其学到的“内部知识”来指导生成。通过修改分布函数,独立调节文本、运动、语义和空间特征的权重,赋予了模型极高的可控性。
实验战绩:全方位超越
DreamWorld 在四大权威榜单上刷新了纪录:
- VBench 2.0:总分 52.97,尤其在人像保真度(Human Fidelity)和复杂情节理解上表现优越。
- VideoPhy:在物理常识(Physical Commonsense)维度上,DreamWorld 取得了 26.2% 的得分,远超 VideoJAM 的 25.3% 和 Wan2.1 的 21.2%。
图 2:定性对比图。可以看到 DreamWorld 在处理杯中液体倾倒(物理流体)和多点互动时,逻辑更加严密。
深度洞察与总结
为什么 DreamWorld 变强了?
其本质提升在于:它不再是单纯地“模仿”视频长什么样,而是在“推理”视频背后的多维属性。 这种将判别式 foundation models 的知识(DINOv2, VGGT)内化为生成式模型预测目标的方法,比起死板的 Representation Alignment 更具柔性。
局限性与未来
虽然在物理逻辑上大有进取,但模型的推理算力开销随特征维度的增加而增长。未来的方向将在于如何更高效地进行多源集成,并结合更广泛的 3D 仿真数据进一步提升对真实物理规律的认知。
Takeaway: 如果你想让视频生成模型更听话、更符合逻辑,不要只是给它更多视频,尝试教它预测这个世界的底层语义和几何规律。
