“实时”对LiDAR场景补全究竟意味着什么?
对于车载激光雷达而言,实时意味着跟上传感器的采集速率——通常是10赫兹,即每0.1秒完成一帧完整场景。这些研究中速度最快的方法RapidLiDAR恰好达到了这一标准:它在0.1秒内完成一帧完整场景,比此前最快的方法快2.3倍[3]。这正是自动驾驶系统需要实时响应世界变化时的实际速度边界。
但速度本身并不等于安全。2024年基于扩散模型的方法LiDiff能生成高质量的补全结果,但蒸馏前每帧需要30.55秒,即便经过优化后仍需5.37秒——远未达到实时要求[1]。因此,界限不只是“足够快”,而是“在足够准确、值得信赖的前提下足够快”。0.1秒是目标,但只有少数方法能达到,而且它们往往以牺牲部分补全质量为代价。
安全边界应划在哪里?这取决于缺失数据的类型。
2026年一项受控研究的关键洞见在于,安全边界并非一条单一界线,而是一组界线,具体取决于你试图填补的间隙类型。该研究将一种迭代细化器(花费额外计算资源细化粗略预测)与一种更宽的一次性预测器(使用更多参数但仅预测一次)进行了对比。当缺失数据构成连贯间隙时——例如扫描中移除的连续角度区域——迭代系统在平均交并比(mIoU,衡量预测几何与真实值重叠程度的指标)上比宽控制组提升了0.911个百分点,其置信区间超过了预先声明的0.5个百分点实际边际[2]。这意味着,对于大型、连续的孔洞,在细化上投入额外计算是值得的。
但对于独立稀疏化——即随机移除75%的点——迭代仅增加了0.300分,而用更多样化的观测数据扩充训练集则增加了5.975分[2]。因此,如果你的传感器产生稀疏、分散的回波,安全边界应设在训练端,而非推理端。而对于附加杂波——即本不应存在的虚假点——两种方法都毫无帮助[2]。这说明实时系统需要知道自己面临的是哪种退化类型;一刀切的安全边界至少会在一种场景下失效。
系统设计者实际应该做什么?
如果你正在构建一个实时LiDAR补全系统,现有证据表明,你应该从一种快速、单次预测的模型入手,比如RapidLiDAR [3],它每帧只需0.1秒。然后,如果你知道传感器数据中存在连贯的间隙(例如,由大型物体造成的遮挡),再添加一个固定深度的细化步骤——但前提是你的计算预算允许。文献[2]中的迭代系统每帧耗时10.74毫秒、占用0.75 GiB内存,而宽泛对照组则只需6.25毫秒和0.23 GiB——因此细化步骤大约慢70%,且内存使用量是原来的3倍。对于嵌入式系统来说,这是一个实实在在的权衡。
对于稀疏、零散的数据,更值得投入的是训练覆盖度——让模型接触更多样化的部分扫描——而不是额外的推理计算量[2]。而对于叠加的杂波,你需要完全不同的鲁棒性机制,比如异常值剔除或传感器融合,因为无论是细化还是扩大模型都无法解决这个问题[2]。归根结底:你的安全边界应基于传感器和环境的主要失效模式来划定,而不是依据一个通用的速度目标。这里的研究一致认为实时是可行的,但它们也表明“实时”和“安全”并非同一回事——你必须选择把计算和训练资源花在哪里。
关于这些来源
此回答基于5项研究(3项经同行评审,2项为预印本),发表于2023年至2026年间,其中4项为2024年或之后发表。这些研究是从7项通过质量筛选的研究中选出的最相关成果,而7项研究又源自从超过5亿篇论文数据库中检索到的52篇文献。
本文引用的文献
将扩散模型蒸馏为高效的3D LiDAR场景补全
ScoreLiDAR将扩散模型蒸馏用于LiDAR场景补全,在SemanticKITTI上将每帧处理时间从30.55秒缩短至5.37秒(提速超过5倍),同时提升了质量,但仍未达到实时水平。
迭代还是扩展?测试时细化何时有助于LiDAR场景补全:关于证据几何、训练覆盖范围与计算资源的受控研究
在一项涵盖815帧SemanticKITTI数据的受控研究中,迭代细化方法在连贯间隙上比更宽的单次预测器高出0.911个mIoU点,但在75%稀疏化场景下仅高出0.300个点,而训练增强则额外贡献了5.975个点;固定加性杂波对两者均无影响,且细化处理每帧耗时10.74毫秒、占用0.75 GiB内存。
迈向实时且自适应的LiDAR场景补全
RapidLiDAR在SemanticKITTI和KITTI-360上仅需0.1秒即可完成整个场景的解析(比此前最快方法快2.3倍),与10 Hz激光雷达的采集频率相匹配,且性能与当前最先进水平相当。
将扩散模型扩展到真实世界3D LiDAR场景补全
LiDiff直接将扩散应用于点云以进行场景级补全,生成比先前方法更详细的场景,但无法实现实时性能。
SSC-RS:通过表示分离与BEV融合提升LiDAR语义场景补全
SSC-RS采用分离的语义分支和几何分支,并通过BEV融合,在SemanticKITTI上实现了最先进的性能,同时能够实时运行。
