[ICLR 2025] LGTM:少即是多,前馈 3D 飞跃 4K 纹理时代
Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting
本文提出了 LGTM (Less Gaussians, Texture More),一种全新的前馈 3D Gaussian Splatting 框架。通过将几何预测与纹理预测解耦,LGTM 首次在无需场景优化的情况下,实现了高达 4K 分辨率的高保真新视角合成,并在大幅减少 Gaussian 基元数量的同时达到了 SOTA 性能。
TL;DR
传统的 3D Gaussian Splatting (3DGS) 在面对高分辨率需求时,往往陷入“像素越多,基元(Primitives)越多”的二次复杂度泥潭。本文提出的 LGTM (Less Gaussians, Texture More) 框架,通过给每个 Gaussian 基元“贴上”精细的纹理贴图,彻底解耦了几何复杂度与渲染分辨率,实现在单显存 A100 上轻松完成 4K 前馈(Feed-forward)重建。
背景定位:前馈重建的分辨率天花板
目前的通用重建方法(Generalizable 3DGS)面临一个核心尴尬:为了保证推理速度,必须使用前馈模型直接预测基元;但由于基元通常是像素对齐的(Pixel-aligned),渲染 4K 图像理论上需要数百万个基元。这导致 GPU 显存直接崩溃(OOM)。

核心直觉:低频几何与高频纹理的解耦
作者敏锐地察觉到:现实世界中,物体的几何形状(Geometry)往往是相对简单的(低频),而物体表面的图案(Appearance)极其复杂(高频)。
- LGTM 的解法:用少量的 2D 磁盘状 Gaussian 捕捉形状,再用纹理贴图覆盖表面。
- Dual-network 架构:
- Primitive Network:在低分辨率下预测几何参数(位置、缩放、旋转)。
- Texture Network:在高分辨率下利用图像补丁化(Patchification)和投影映射提取细节。
技术亮点:学习型投影纹理(Learned Projective Texturing)
LGTM 不仅仅是简单的纹理贴图,它引入了 投影先验(Projective Prior)。系统将源视图的高清像素“反向渲染”到基元的局部纹理坐标系中。这种方法绕过了复杂的网络推导,直接利用了图像原有的细节,使得模型即使在 8x8 这种极小的每个基元纹理尺寸下,也能还原出惊人的细节。
实验结果:降维打击
在 DL3DV 数据集的 4K 任务中,LGTM 在性能和资源消耗上展示了统治级优势:
- 效率:像素增加了 64 倍,但 LGTM 的内存开销仅增加 1.8 倍。
- 画质:LPIPS(感知损失)大幅下降,视觉效果远超那些产生“孔洞”或“虚化”的传统 3DGS 基线。

从对比图中可以明显看出,LGTM(最右侧)处理高频细节(如建筑物纹理、文字)的能力远强于 vanilla 2DGS,且完全没有每场景优化方法常见的过拟合伪影。
深度洞察与总结
LGTM 的成功标志着通用重建任务从“暴力堆砌基元”向“高效表征学习”的转变。
- 局限性:尽管外观精美,但其架构对初始几何预测的依赖性很高。如果几何预测失准(例如在遮挡场景下),纹理贴图也难以挽救。
- 未来展望:这种“几何+纹理”的混合表征非常契合传统图形学管线,未来极有可能成为端侧(如 Meta Quest, Apple Vision Pro)实时 3D 资产生成的标准范式。
总结一句话:既然 1024x1024 的像素不需要 1024x1024 个三角形,为什么 3D 渲染需要那么多 Gaussian?LGTM 给了我们一个优雅的答案。
