[CVPR 2026 预研] ImprovedGS+:原生 CUDA 重构,定义 3D 高斯泼溅性能新基准
ImprovedGS+: A High-Performance C++/CUDA Re-Implementation Strategy for 3D Gaussian Splatting
本文提出了 ImprovedGS+,一种基于 LichtFeld-Studio 框架的 3D Gaussian Splatting (3DGS) 高性能 C++/CUDA 原生实现。该方法通过长轴分裂 (Long-Axis-Split, LAS) 算子、增强型拉普拉斯边缘掩码以及自适应指数缩放调度器,在 Mip-NeRF360 数据集上显著提升了重建质量与训练速度,实现了新的 Pareto 最优。
TL;DR
在 3D 场景重建领域,如何兼顾“极致速度”与“电影级画质”始终是核心矛盾。本文提出的 ImprovedGS+ 通过彻底抛弃高层级的 Python 加密逻辑,采用全原生 C++/CUDA 架构,不仅将训练耗时缩短了 26.8%,更在减少 13.3% 参数量的前提下,实现了超越 SOTA 的重建精度。
背景定位
ImprovedGS+ 是对 ImprovedGS 和 TamingGS 策略的底层重构。它不再仅仅是一个算法改进版本,而是一次算力潜能的深挖。通过将其整合进 LichtFeld-Studio 生态,该研究直接向工业级实时渲染和大规模场景建模迈进。
痛点深挖:消失在 Python 中的性能
虽然 3DGS 的渲染速度极快,但其训练过程中的 Densification(加密) 环节往往是性能瓶颈。
- 同步开销:PyTorch 的函数调用涉及频繁的 CPU 与 GPU 通信。
- 冗余表示:传统的克隆(Cloning)策略容易在平面产生重复的高斯点(Stipple Noise)。
- 精度与效率的博弈:目前的算法很难在保持低参数量的同时,捕捉到高频边缘细节。
核心方法论:底层架构的“手术刀级”优化
1. 原生 CUDA 长轴分裂 (LAS)
作者开发了一个专门的 CUDA Kernel 替代了 PyTorch 组合操作。在分裂高斯点时,不再进行全量矩阵运算,而是利用旋转矩阵的属性,直接提取主轴列进行线性缩放。
- 计算简化:将 9 次乘法和 6 次加法简化为仅 3 次乘法。
- 数值一致性:直接在对数空间操作物理参数,保证了数值稳定性。
(Algorithm 1 展示了如何在 In-place 条件下直接更新高斯属性)
2. 拉普拉斯边缘掩码与 NMS
为了防止“加密漂移”(Densification Drift),ImprovedGS+ 引入了类似 Canny 算子的精细滤波器。通过 Non-Maximum Suppression (NMS),算法能精准定位几何流形(Geometric Manifold),确保高斯点只被放置在真正的结构边界上。
- 这种方法消除了背景中的噪点,使高斯点的分布更加具有“几何显著性”。
3. 指数缩放调度器(Exponential Scale Scheduler)
作者发现,固定的学习率无法处理从“占据空间”到“精细刻画”的转变。
- 第一阶段:通过 4 倍初始学习率进行高动量扩张。
- 第二阶段:使用指数衰减锁定细节,防止在高频区域产生振荡。
实验战绩:Pareto 曲线的全面超越
在 Mip-NeRF360 的多个严苛场景下,ImprovedGS+ 展现了统治级的表现。下表揭示了在 1M 预算限制下,ImprovedGS+ 是如何在牺牲更少资源的情况下反杀基线的。
(表 3 显示:在相同硬件环境下,ImprovedGS+ 比 MCMC 快了 17 分钟,PSNR 反而更高)
消融实验揭示:
- 位置学习率(Position LR) 的优化对于捕捉复杂室外场景(如 Garden)至关重要。
- Scale Scheduler 的加入直接为室内场景贡献了约 0.42 dB 的 PSNR 增益。
深度洞察与总结
ImprovedGS+ 的成功再次证明了:在深度学习进入下半场时,底层优化与数学直觉的结合比单纯的参数堆砌更有效。它通过精确的算子融合和基于物理意义的启发式策略(如 LAS),让 1.6M 个高斯点发挥出了 3M 个点才有的精细度。
局限性:尽管性能卓越,但在处理极大规模的无界场景时,VRAM 的带宽消耗仍有进一步优化的空间。作者提出的 Kernel Fusion(核融合) 可能是未来的关键突破点。
启示:未来的 3D 生成或重建工作,应该更多地关注如何让算子“理解”几何,而不是依赖框架层面的自动微分黑盒。
