DVD:离散体素扩散,重塑 3D 生成的几何骨架
DVD: Discrete Voxel Diffusion for 3D Generation and Editing
本文提出了 Discrete Voxel Diffusion (DVD),一种基于离散扩散模型的 3D 稀疏体素生成框架。作为 S L AT 架构的第一阶段先验,DVD 在图像生成 3D 和文本生成 3D 任务中均达到了 SOTA 水平,显著提升了几何保真度。
TL;DR
在 3D 生成领域,如何精准捕捉物体的“骨架”是高保真生成的关键。本文提出的 DVD (Discrete Voxel Diffusion) 抛弃了传统将体素视为连续信号的策略,转而采用原生离散扩散模型。它不仅解决了 3D 模型中常见的“断裂”与“空洞”难题,还引入了基于熵的不确定度量化工具,甚至能在一轮采样内完成局部编辑。
1. 痛点:连续建模的“阈值陷阱”
目前的 S L AT(结构化潜变量)管线(如 TRELLIS)通常分两步:先生成稀疏体素支架,再在上面挂载特征。然而,第一步通常将体素索引通过 VAE 转为连续向量进行扩散。
为什么这有问题? 体素占据本质上是 0 或 1 的二值信号。在连续空间建模后,必须通过一个“阈值”来强行转回离散状态。这会导致:
- 薄壁塌陷:对于精细的薄片结构,微小的平滑误差就会让输出值跌破阈值,导致生成的物体满是“弹孔”。
- 缺乏反馈:连续模型很难直观告诉我们,它对某个区域的生成到底有多大把握。
上图展示了连续模型在处理复杂结构时容易产生不连贯的空洞,而 DVD(右侧)则能保持完美的几何拓扑。
2. 核心方法:离散扩散与 USDM
DVD 采用了 Uniform State Discrete Diffusion (USDM)。不同于掩码模型(Masked Models),USDM 的每个体素在加噪过程中会以一定概率在 0 和 1 之间随机翻转。
2.1 显式分类建模
在反向去噪过程中,模型预测的是每个体素属于“占据态”的概率 。这种建模方式直接对齐了数据的离散本质,消除了二值化的解析偏差。
2.2 块结构扰动 (BSP)
为了让模型具备强大的编辑能力,作者开发了 Block-Structured Perturbations (BSP)。在微调阶段,模型不是接受均匀噪声,而是被喂入一些被成块抠掉的“空洞”样本。这种策略让模型学会了如何根据周围完整的上下文(Context)来预测缺失的局部结构,从而在单次采样中支持 Inpainting。

3. 创新之处:几何不确定度 (Uncertainty)
由于 DVD 显式地输出了概率分布,我们可以计算预测熵 (Predictive Entropy)。
- 体素级:熵高的区域通常对应物体的细节(如灭火器的把手、房顶的凸起)。
- 形状级:通过聚合整网格的熵,作者得到了一个重量级的复杂度指标 。
利用这个指标,开发者可以自动从海量 3D 数据库中筛选出“高难度的精细样本”并加强训练。实验证明,利用该指标进行数据增强后,模型性能得到了进一步飞跃。
亮紫色代表高熵区域,完美捕捉了 3D 模型中的复杂几何特征。
4. 实验战绩
在与当前最强的 TRELLIS 对比中,DVD 表现出色:
- 几何精度:CDV(体素倒角距离)从 0.0199 降低到了 0.0107,提升了近一倍。
- 编辑能力:引入 BSP 后,Inpainting 的几何 FID 指标显著优于传统的 Repaint 策略。

5. 资深主编点评
DVD 的成功再次印证了一个学术直觉:数据的底层表征如果是离散的,那么强行映射到连续空间往往会带来额外的归纳偏置负担。
该工作不仅提升了生成质量,最令我赞赏的是其对“不确定度”的深度挖掘。在 3D 数据质量参差不齐的当下,能够自动识别并专注于“困难样本”的生成模型,极具工业应用潜力。尽管目前仍需要数百步采样(NFE 较高),但其作为第一阶段支架生成器的稳定性,已为其在 3D 原生编辑器中的应用铺平了道路。
局限性分析
- 效率瓶颈:由于采用离散扩散,NFE(函数评估次数)依然较高,实时生成尚有挑战。
- 离散间隙:虽然解决了支架问题,但在与第二阶段(连续 Latent 预测)的联合优化上仍有探讨空间。
