[CVPR 2026 预研] ImprovedGS+:原生 CUDA 重构,定义 3D 高斯泼溅性能新基准

ImprovedGS+: A High-Performance C++/CUDA Re-Implementation Strategy for 3D Gaussian Splatting

总结
问题
方法
结果
要点
摘要

本文提出了 ImprovedGS+,一种基于 LichtFeld-Studio 框架的 3D Gaussian Splatting (3DGS) 高性能 C++/CUDA 原生实现。该方法通过长轴分裂 (Long-Axis-Split, LAS) 算子、增强型拉普拉斯边缘掩码以及自适应指数缩放调度器,在 Mip-NeRF360 数据集上显著提升了重建质量与训练速度,实现了新的 Pareto 最优。

TL;DR

在 3D 场景重建领域,如何兼顾“极致速度”与“电影级画质”始终是核心矛盾。本文提出的 ImprovedGS+ 通过彻底抛弃高层级的 Python 加密逻辑,采用全原生 C++/CUDA 架构,不仅将训练耗时缩短了 26.8%,更在减少 13.3% 参数量的前提下,实现了超越 SOTA 的重建精度。

背景定位

ImprovedGS+ 是对 ImprovedGS 和 TamingGS 策略的底层重构。它不再仅仅是一个算法改进版本,而是一次算力潜能的深挖。通过将其整合进 LichtFeld-Studio 生态,该研究直接向工业级实时渲染和大规模场景建模迈进。

痛点深挖:消失在 Python 中的性能

虽然 3DGS 的渲染速度极快,但其训练过程中的 Densification(加密) 环节往往是性能瓶颈。

  1. 同步开销:PyTorch 的函数调用涉及频繁的 CPU 与 GPU 通信。
  2. 冗余表示:传统的克隆(Cloning)策略容易在平面产生重复的高斯点(Stipple Noise)。
  3. 精度与效率的博弈:目前的算法很难在保持低参数量的同时,捕捉到高频边缘细节。

核心方法论:底层架构的“手术刀级”优化

1. 原生 CUDA 长轴分裂 (LAS)

作者开发了一个专门的 CUDA Kernel 替代了 PyTorch 组合操作。在分裂高斯点时,不再进行全量矩阵运算,而是利用旋转矩阵的属性,直接提取主轴列进行线性缩放。

  • 计算简化:将 9 次乘法和 6 次加法简化为仅 3 次乘法
  • 数值一致性:直接在对数空间操作物理参数,保证了数值稳定性。

LAS 加密逻辑示意图 (Algorithm 1 展示了如何在 In-place 条件下直接更新高斯属性)

2. 拉普拉斯边缘掩码与 NMS

为了防止“加密漂移”(Densification Drift),ImprovedGS+ 引入了类似 Canny 算子的精细滤波器。通过 Non-Maximum Suppression (NMS),算法能精准定位几何流形(Geometric Manifold),确保高斯点只被放置在真正的结构边界上。

  • 这种方法消除了背景中的噪点,使高斯点的分布更加具有“几何显著性”。

3. 指数缩放调度器(Exponential Scale Scheduler)

作者发现,固定的学习率无法处理从“占据空间”到“精细刻画”的转变。

  • 第一阶段:通过 4 倍初始学习率进行高动量扩张。
  • 第二阶段:使用指数衰减锁定细节,防止在高频区域产生振荡。

实验战绩:Pareto 曲线的全面超越

在 Mip-NeRF360 的多个严苛场景下,ImprovedGS+ 展现了统治级的表现。下表揭示了在 1M 预算限制下,ImprovedGS+ 是如何在牺牲更少资源的情况下反杀基线的。

实验结果对比 (表 3 显示:在相同硬件环境下,ImprovedGS+ 比 MCMC 快了 17 分钟,PSNR 反而更高)

消融实验揭示:

  • 位置学习率(Position LR) 的优化对于捕捉复杂室外场景(如 Garden)至关重要。
  • Scale Scheduler 的加入直接为室内场景贡献了约 0.42 dB 的 PSNR 增益。

深度洞察与总结

ImprovedGS+ 的成功再次证明了:在深度学习进入下半场时,底层优化与数学直觉的结合比单纯的参数堆砌更有效。它通过精确的算子融合和基于物理意义的启发式策略(如 LAS),让 1.6M 个高斯点发挥出了 3M 个点才有的精细度。

局限性:尽管性能卓越,但在处理极大规模的无界场景时,VRAM 的带宽消耗仍有进一步优化的空间。作者提出的 Kernel Fusion(核融合) 可能是未来的关键突破点。

启示:未来的 3D 生成或重建工作,应该更多地关注如何让算子“理解”几何,而不是依赖框架层面的自动微分黑盒。

发现相似论文

试试这些示例

  • 查找其他通过将 Python/PyTorch 逻辑重写为原生 CUDA 核来加速 3D Gaussian Splatting 的相关论文。
  • 哪篇论文最早提出了 3DGS 的 Long-Axis-Split (LAS) 概念,ImprovedGS+ 在其基础上做了哪些具体的数学优化?
  • 有哪些研究在机器人实时 SLAM 或大场景重建任务中应用了 ImprovedGS+ 类似的边缘重要性采样机制?
目录
[CVPR 2026 预研] ImprovedGS+:原生 CUDA 重构,定义 3D 高斯泼溅性能新基准
1. TL;DR
2. 背景定位
3. 痛点深挖:消失在 Python 中的性能
4. 核心方法论:底层架构的“手术刀级”优化
4.1. 1. 原生 CUDA 长轴分裂 (LAS)
4.2. 2. 拉普拉斯边缘掩码与 NMS
4.3. 3. 指数缩放调度器(Exponential Scale Scheduler)
5. 实验战绩:Pareto 曲线的全面超越
5.1. 消融实验揭示:
6. 深度洞察与总结