[Meta Meta AI 2025] WorldGen:从文本直接生成可交互、可导航的 3D 游戏大世界

Wang et al. - 2025 - WorldGen From Text to Traversable and Interactive 3D Worlds.pdf

总结
问题
方法
结果
要点

本文推出了 WorldGen,一个由 Meta 开发的能够从文本提示语生成大规模、可交互且可导航 3D 世界的系统。该方法结合了 LLM 布局推理、程序化生成、扩散模型及自动化场景分解,实现了与游戏引擎(如 Unreal/Unity)高度兼容的网格化场景产出。

TL;DR

Meta 提出的 WorldGen 正式打破了 3D 生成 AI 仅能产出“精致摆件”的局限。它不仅能通过一段话生成 50x50 米的大型 3D 场景,更重要的是,它产出的场景是功能化的——自带导航网格(Navmesh),且通过了自动化分解(Decomposition),这意味着生成的模型可以直接拖入 Unreal Engine 进行游戏开发,角色可以在其中自由行走,而不会被错乱的几何体卡住。

痛点深挖:为什么“生成世界”比“生成物体”难得多?

目前的 3D 生成 AI 面临三个核心挑战:

  1. 缺乏常识布局:AI 可能会在餐桌中间生成一颗树,或者生成的道路无法通行。
  2. 恐怖的资源消耗:直接生成一整个高精度场景网格对算力和显存是灾难性的。
  3. 单体化僵局:很多方法生成的场景是“一坨”三角形面片,开发者无法移动其中的一张椅子或一棵树。

方法论详解:WorldGen 的四阶段炼金术

WorldGen 并没有尝试暴力硬解从文本到场景的映射,而是模仿了人类关卡设计师的工作流:

1. 场景规划 (Scene Planning) —— “打草稿”

系统首先利用 LLM 解析用户的 prompt(如“中世纪小镇”),生成 JSON 格式的布局参数。然后通过程序化生成 (PG) 技术创建一个 Blockout(简单的方块堆砌版场景)和 Navmesh

模型架构图 图 1:WorldGen 的全流程:从布局规划到最终增强。

2. 场景重建 (Scene Reconstruction) —— “初具规模”

在这一阶段,WorldGen 使用了 Meta 改进的 AssetGen2。不同于传统模型,它不仅看参考图(Reference Image),还被强行加入了 Navmesh 作为硬性约束。这保证了生成的地形在物理上是平滑可走的。

3. 场景分解 (Scene Decomposition) —— “化整为零”

这是实现“可交互性”的关键。利用 AutoPartGen,系统会自动识别出地面、建筑和植物。为了提速,团队引入了基于连接度的并行处理机制,将原本需要 10 分钟的分解过程缩短到了 1 分钟左右。

4. 场景增强 (Scene Enhancement) —— “细节雕琢”

这是视觉效果飞跃的阶段。系统会给分解后的每个物体(如一根路灯)单独“拍照”,利用多模态大模型(VLM)进行高清重绘,再重新生成高精度的几何与 UV 纹理。

实验结果对比 图 2:Navmesh 约束前后的对比。可见加入 Navmesh 后,地面的平整度和逻辑性显著提升。

实验与结果:比 World Labs 的 Marble 强在哪?

最近备受关注的 World Labs 推出的 Marble 系统虽然通过 Gaussian Splatting 实现了极高的照片级真实感,但 WorldGen 展现了不同的工业路径:

  • 兼容性:WorldGen 输出的是标准的纹理网格(Mesh),任何移动端硬件都能跑,而 GS 对普通游戏引擎的渲染压力极大。
  • 可编辑性:WorldGen 生成的森林场景,你可以手动挪开一颗树。在 Marble 中,这几乎不可能。
  • 空间范围:WorldGen 能维持 50 乘 50 米的一致性,而基于视角扩散的方法通常在移动几米后就会出现严重的几何畸变。

深度洞察:未来 3D 创作的范式转移

WorldGen 的出现标志着 3D 生成式 AI 进入了 “语义驱动的工程化阶段”。通过将确定性的程序化规则(PG)与模糊性的生成式模型(Diffusion)结合,Meta 找到了平衡“创造力”与“功能性”的钥匙。

局限性:目前 WorldGen 仍然极度依赖单视角参考图,这限制了它生成多层建筑(如拥有复杂内部结构的五层公寓)的能力。此外,如何在大规模生成中保持纹理贴图的复用以减少带宽压力,仍是一个待解决的技术挑战。

总结来说,WorldGen 不仅仅是在生成图片,它是在生成“可以跑的游戏关卡”。这对于元宇宙、模拟训练和独立游戏开发者来说,无疑是核弹级的工具革新。

发现相似论文

试试这些示例

  • 查找最近其他结合程序化生成 (Procedural Generation) 与扩散模型 (Diffusion Models) 来增强 3D 场景空间一致性的研究。
  • AssetGen2 论文中提到的 VecSet 潜空间表征是如何在处理复杂场景几何时保持高效的?
  • 目前有哪些研究尝试解决 3D 场景生成中的“长程一致性”问题,以实现超公里级别的无缝大世界生成?
目录
[Meta Meta AI 2025] WorldGen:从文本直接生成可交互、可导航的 3D 游戏大世界
1. TL;DR
2. 痛点深挖:为什么“生成世界”比“生成物体”难得多?
3. 方法论详解:WorldGen 的四阶段炼金术
3.1. 1. 场景规划 (Scene Planning) —— “打草稿”
3.2. 2. 场景重建 (Scene Reconstruction) —— “初具规模”
3.3. 3. 场景分解 (Scene Decomposition) —— “化整为零”
3.4. 4. 场景增强 (Scene Enhancement) —— “细节雕琢”
4. 实验与结果:比 World Labs 的 Marble 强在哪?
5. 深度洞察:未来 3D 创作的范式转移