[CVPR 2024] Fase3D:告别重型编码器,傅里叶变换重塑高效 3D 大模型
Efficient Encoder-Free Fourier-based 3D Large Multimodal Model
本文提出了 Fase3D,这是首个面向 3D 场景理解的无编码器(Encoder-Free)大模型。通过结合 SFC 序列化与快速傅里叶变换(FFT),Fase3D 能够直接在 LLM 的 token 空间内高效处理无序点云,在性能不输于、甚至超越传统基于重型 3D 编码器模型的同时,实现了参数量和计算开销的数量级缩减。
TL;DR
在 3D 多模态(3D LMM)领域,大家一直习惯于给 LLM 挂载一个沉重的“视觉书架”——预训练 3D 编码器。Fase3D 打破了这一常规,通过傅里叶变换(FFT)和空间填充曲线(SFC),首次实现了无编码器(Encoder-free)的 3D 场景理解。它在保持 SOTA 性能的同时,将视觉算力开销降低了 15 倍以上,视觉参数量仅需 10M 左右。
痛点深挖:为什么 3D 领域离不开“重型编码器”?
传统的 3D LMM(如 3D-LLaVA, LL3DA)通常遵循“编码器 + 投影器 + 语言模型”的架构。其痛点在于:
- 效率瓶颈:像 3D U-Net 这样的编码器在处理大规模场景时内存占用极高。
- 语义鸿沟:预训练编码器的几何特征往往与 LLM 的推理需求不完全对齐。
- 扩展性差:点云是无序的,直接喂给 LLM 会导致序列过长(Quadratic Complexity),如果采用简单的下采样又会丢失空间结构。
Fase3D 的核心直觉是:如果能像处理数字信号一样,在频域内捕获点云的全局特征,是否就能省掉复杂的卷积或稀疏算子?
Methodology:频域与空域的华丽交响
Fase3D 的架构设计巧妙地避开了显式的重型特征提取,其核心流程如下:
1. 结构化超点序列化(Tokenization)
模型首先将点云简化为超点(Superpoints)。为了让 LLM 能读懂空间位置,Fase3D 使用了空间填充曲线(Space-filling Curves, SFC),如 Hilbert 曲线和 Z-order 曲线。这种技术能将 3D 坐标映射为 1D 序列,且能最大限度地保留空间局部性。
2. 基于 FFT 的上下文增强器
这是 Fase3D 的灵魂所在。研究者发现,自注意力机制(Self-Attention)本质上是在做特征过滤。
- 模型对 SFC 序列执行 1D FFT。
- 在频域内保留低频分量(全局布局),滤除高频噪声。
- 通过逆 FFT 映射回空间域。 这一步仅需 的复杂度,就实现了类似全局注意力的效果。

3. 图驱动的 Token 融合(Token Merging)
为了进一步提效,Fase3D 利用稀疏图构建(窗口投票机制)来识别哪些超点属于同一物体,并通过 Sinkhorn 算法进行微分软聚类,将 Token 数量压缩到 256 个。
4. 傅里叶增强 LoRA (Fourier-augmented LoRA)
在 LLM 内部,作者并没有简单的使用 LoRA,而是设计了一个轻量级的全局滤波器分支。这个分支在通道维度上进行频谱混合,增强了模型处理远距离空间关系的能力。
实验结果:以轻博重的胜利
性能对比:ScanQA 与 SQA3D
测试结果显示,Fase3D 在多项指标上不仅追平了 3D-LLaVA 等有编码器模型,在 CIDEr 指标上甚至有所超越。

效率降维打击
- 计算量 (FLOPs):从其他模型的 37G-163G 骤降至 2.04G。
- 视觉参数:仅需 10M 左右,相比之前主流的 120M 减少了一个数量级。
定性分析
在物体关系判断(如“椅子距离植物有多近”)和细粒度描述(描述枕头位置)上,Fase3D 表现出了极高的空间感知精度。这证明了通过 FFT 捕捉频率特征,确实能替代复杂的层级几何特征提取。

深度洞察与总结
Fase3D 的意义在于它回归了信号处理的本质。 长期以来,3D 社区沉迷于在空间域堆叠复杂的几何算子,而 Fase3D 告诉我们:通过巧妙的序列化和频域滤波,LLM 本身强大的注意力池化能力就可以处理 3D 数据。
局限性: 尽管 Fase3D 在结构化场景表现优异,但在非欧几里得长程关系(如极度拥挤杂乱的工业场景)中,单纯依赖 SFC 序列化可能会存在拓扑断裂。
展望: 这一无编码器范式非常适合资源受限的端侧设备(如 AR 眼镜、入门级机器人)。未来,将这种频谱增强技术扩展到多模态预训练(如加入 RGB 信息)将是大势所趋。
