[Meta Meta AI 2025] WorldGen:从文本直接生成可交互、可导航的 3D 游戏大世界
Wang et al. - 2025 - WorldGen From Text to Traversable and Interactive 3D Worlds.pdf
本文推出了 WorldGen,一个由 Meta 开发的能够从文本提示语生成大规模、可交互且可导航 3D 世界的系统。该方法结合了 LLM 布局推理、程序化生成、扩散模型及自动化场景分解,实现了与游戏引擎(如 Unreal/Unity)高度兼容的网格化场景产出。
TL;DR
Meta 提出的 WorldGen 正式打破了 3D 生成 AI 仅能产出“精致摆件”的局限。它不仅能通过一段话生成 50x50 米的大型 3D 场景,更重要的是,它产出的场景是功能化的——自带导航网格(Navmesh),且通过了自动化分解(Decomposition),这意味着生成的模型可以直接拖入 Unreal Engine 进行游戏开发,角色可以在其中自由行走,而不会被错乱的几何体卡住。
痛点深挖:为什么“生成世界”比“生成物体”难得多?
目前的 3D 生成 AI 面临三个核心挑战:
- 缺乏常识布局:AI 可能会在餐桌中间生成一颗树,或者生成的道路无法通行。
- 恐怖的资源消耗:直接生成一整个高精度场景网格对算力和显存是灾难性的。
- 单体化僵局:很多方法生成的场景是“一坨”三角形面片,开发者无法移动其中的一张椅子或一棵树。
方法论详解:WorldGen 的四阶段炼金术
WorldGen 并没有尝试暴力硬解从文本到场景的映射,而是模仿了人类关卡设计师的工作流:
1. 场景规划 (Scene Planning) —— “打草稿”
系统首先利用 LLM 解析用户的 prompt(如“中世纪小镇”),生成 JSON 格式的布局参数。然后通过程序化生成 (PG) 技术创建一个 Blockout(简单的方块堆砌版场景)和 Navmesh。
图 1:WorldGen 的全流程:从布局规划到最终增强。
2. 场景重建 (Scene Reconstruction) —— “初具规模”
在这一阶段,WorldGen 使用了 Meta 改进的 AssetGen2。不同于传统模型,它不仅看参考图(Reference Image),还被强行加入了 Navmesh 作为硬性约束。这保证了生成的地形在物理上是平滑可走的。
3. 场景分解 (Scene Decomposition) —— “化整为零”
这是实现“可交互性”的关键。利用 AutoPartGen,系统会自动识别出地面、建筑和植物。为了提速,团队引入了基于连接度的并行处理机制,将原本需要 10 分钟的分解过程缩短到了 1 分钟左右。
4. 场景增强 (Scene Enhancement) —— “细节雕琢”
这是视觉效果飞跃的阶段。系统会给分解后的每个物体(如一根路灯)单独“拍照”,利用多模态大模型(VLM)进行高清重绘,再重新生成高精度的几何与 UV 纹理。
图 2:Navmesh 约束前后的对比。可见加入 Navmesh 后,地面的平整度和逻辑性显著提升。
实验与结果:比 World Labs 的 Marble 强在哪?
最近备受关注的 World Labs 推出的 Marble 系统虽然通过 Gaussian Splatting 实现了极高的照片级真实感,但 WorldGen 展现了不同的工业路径:
- 兼容性:WorldGen 输出的是标准的纹理网格(Mesh),任何移动端硬件都能跑,而 GS 对普通游戏引擎的渲染压力极大。
- 可编辑性:WorldGen 生成的森林场景,你可以手动挪开一颗树。在 Marble 中,这几乎不可能。
- 空间范围:WorldGen 能维持 50 乘 50 米的一致性,而基于视角扩散的方法通常在移动几米后就会出现严重的几何畸变。
深度洞察:未来 3D 创作的范式转移
WorldGen 的出现标志着 3D 生成式 AI 进入了 “语义驱动的工程化阶段”。通过将确定性的程序化规则(PG)与模糊性的生成式模型(Diffusion)结合,Meta 找到了平衡“创造力”与“功能性”的钥匙。
局限性:目前 WorldGen 仍然极度依赖单视角参考图,这限制了它生成多层建筑(如拥有复杂内部结构的五层公寓)的能力。此外,如何在大规模生成中保持纹理贴图的复用以减少带宽压力,仍是一个待解决的技术挑战。
总结来说,WorldGen 不仅仅是在生成图片,它是在生成“可以跑的游戏关卡”。这对于元宇宙、模拟训练和独立游戏开发者来说,无疑是核弹级的工具革新。
