[CVPR 2025] FACE:从顶点到面片,开启高保真 3D 网格生成的新范式

FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

总结
问题
方法
结果
要点
摘要

本文提出了 FACE,一种新型的自回归自动编码器(ARAE)框架,通过“一面一标记”(one-face-one-token)策略实现了高效的高保真 3D 网格生成。该方法在保持 SOTA 重建质量的同时,将序列长度缩短至原来的 1/9,达到了 0.11 的极致压缩比。

TL;DR

在 3D 生成领域,直接生成高质量的三角网格(Triangle Mesh)一直是“圣杯”任务。本文提出的 FACE (Face-based Autoregressive Representation) 突破了传统自回归模型依赖冗长顶点序列的瓶颈。通过首创的 “一面一标记”(one-face-one-token) 策略,FACE 将计算效率提升了 9 倍,压缩比达到 0.11 的 SOTA 水平,同时在模型重建精度上刷新了多项记录。

核心痛点:被“淹没”在坐标序列里的 Transformer

目前的自回归模型(如 MeshGPT, MeshXL)大多遵循一个逻辑:将 3D 网格拆解为一串顶点坐标或边缘序列。

  • 效率低下:一个简单的模型若包含数千个面,对应的坐标序列长度会轻松突破万级。Transformer 的自注意力计算成本随长度平方增长,这导致长序列生成变得极其昂贵。
  • 语义缺失:单一坐标值(x, y 或 z)缺乏几何语义,模型需要跨越极长的步长才能“理解”三个顶点如何构成一个面。

FACE 的作者认为:我们选错了语义层级。既然三角面片是网格的基本构建块,为什么不直接以“面”为单位进行生成?

核心方法:One-Face-One-Token

FACE 框架的核心是一个 Autoregressive Autoencoder (ARAE) 结构。

1. 架构解析

  • Shape Encoder (VecSet):利用 Farthest Point Sampling (FPS) 采样点作为 Query,通过 Cross-Attention 聚合全局点云特征,生成紧凑的隐变量集合(VecSet)。
  • One-Face-One-Token 策略:不再将面拆分为 9 个坐标 Token,而是通过一个 Face Pooling 层将 9D 向量直接投影为一个 维度的 Token。
  • 层级自回归头 (CausalMLP):这是本文的神来之笔。在面级别,Transformer 负责整体布局;在面内部,CausalMLP 负责 9 个坐标的因果预测。这种设计既保证了全局的一致性,又捕捉了局部的精确度。

模型架构图 图 1:FACE 的端到端流程。编码器将点云压缩为 VecSet,解码器以面为单位进行自回归生成。

实验战绩:效率与质量的双重飞跃

1. 效率:极致压缩

如表 1 所示,FACE 的压缩比达到了 0.11,相比于此前的 SOTA 方法(如 Mesh-Silksong 的 0.22)直接减半。这意味着在相同的显存预算下,FACE 可以生成面数更多、更复杂的几何体。

2. 重建精度:降维打击

在 Objaverse 和 Toys4K 数据集上,FACE 展现了统治级的表现。其 Hausdorff 距离(HD)和 Chamfer 距离(CD)均显著低于过往方法。

实验结果对比 图 2:可视化对比显示,FACE 生成的网格(右一)在拓扑连续性和细节锐度上远超对手,完全没有碎面或孔洞。

深度洞察:为什么这种简洁的策略更有效?

  1. 空间排序胜过图遍历:作者对比了 BFS/DFS 等复杂的图遍历排序,发现简单的 ZYX 字典序排列 效果最好。这说明在面级别,简单的空间一致性已足以让模型学习到连接律。
  2. 潜空间的通用性:为了证明 FACE 学习到了真正的 3D 几何特征,作者额外训练了一个 Latent Diffusion Model。实验证明,基于 FACE 学习到的隐空间,仅需单张图片即可生成高保真网格,这验证了该框架在多模态应用中的潜力。

总结与展望

FACE 标志着 3D 自回归生成从“坐标时代”进入了“面片时代”。尽管 1024 级的离散量化仍存在精度上限,且对极细结构(如自行车辐条)的采样有待加强,但其 1.2B 参数规模的成功扩展(Ours-large)展示了该路径极强的 Scaling Law 潜力。


资深主编点评:FACE 的成功在于其“大道至简”的直觉。在大家卷遍历算法和分块索引时,回归 3D 渲染最基本的单元——三角面,反而取得了突破性的进展。这再次提醒我们,合适的表示法(Representation)往往比复杂的架构微调更重要。

发现相似论文

试试这些示例

  • 查找最近其他尝试通过提升语义单元层级(如使用 Patch 或更高阶基元)来降低 3D Transformer 计算复杂度的论文。
  • 3DShape2VecSet 论文最初如何定义 VecSet 表示,本文在 FACE 中对其架构做了哪些具体适配?
  • 目前有哪些研究致力于将自回归网格模型(如 FACE)与大型语言模型(LLM)结合以实现多模态 3D 生成?
目录
[CVPR 2025] FACE:从顶点到面片,开启高保真 3D 网格生成的新范式
1. TL;DR
2. 核心痛点:被“淹没”在坐标序列里的 Transformer
3. 核心方法:One-Face-One-Token
3.1. 1. 架构解析
4. 实验战绩:效率与质量的双重飞跃
4.1. 1. 效率:极致压缩
4.2. 2. 重建精度:降维打击
5. 深度洞察:为什么这种简洁的策略更有效?
6. 总结与展望