消费级 LiDAR 的“透视眼”:通过运动诱导采样实现非视距成像
Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling
本文提出了基于消费级 LiDAR 的非视距(NLOS)成像框架,核心方法为运动诱导孔径采样(MAS)模型,并结合粒子滤波实现了多帧融合。在仅使用约 100 美元的智能手机级硬件下,成功实现了 SOTA 级别的 3D 重建、多物体实时追踪及厘米级的相机定位。
TL;DR
想象一下,你的手机屏幕后面长了眼睛,能看到墙角后隐藏的快递盒或正在靠近的人。MIT 的研究团队通过一种名为 运动诱导孔径采样 (Motion-Induced Aperture Sampling, MAS) 的模型,让价值不到 100 美元的消费级 LiDAR(如手机上的 dToF 传感器)具备了这种“透视”能力。他们不仅实现了隐藏物体的 3D 重建,还能在 30 帧/秒下实时追踪多个目标,甚至利用这些看不见的物体为相机导航。
历史坐标:从实验室的千万设备到口袋里的手机
非视距成像(Non-Line-of-Sight, NLOS)此前一直是计算摄影领域的“富人游戏”。它通常需要:
- 皮秒级超快激光器(昂贵且笨重);
- 高灵敏度 SPAD 阵列(科研级);
- 静态环境与长时间曝光。
本文的突破在于,它将视角从“如何使用更强的硬件”转向了“如何利用设备的运动”。在移动互联网和机器人时代,低分辨率和低功率是常态,但运动也是常态。
痛点深挖:消费级 LiDAR 的“软肋”
现有 NLOS 算法无法支持消费级设备,核心原因有三:
- 极低信噪比 (Low SNR):为保护眼睛,激光功率极低,单帧反射回来的光子寥寥无几。
- 空间分辨率贫瘠:科研设备动辄几万采样点,而手机 LiDAR 往往只有 10x10 的点位。
- 运动模糊 (Motion Blur):一旦相机或物体动起来,传统的时间飞回(ToF)公式就会失效。
核心算法:MAS 模型与粒子滤波
作者的核心直觉是:既然单帧数据像一团杂讯,那就把运动当作“采样器”,通过多帧融合构建出一个巨大的虚拟光圈。
1. 运动诱导孔径采样 (MAS)
作者基于 光锥变换 (Light-Cone Transform, LCT),证明了在变换后的空间中,物体运动可以被简化为一种 3D 卷积位移。 这意味着,只要知道相机的位姿,就可以把每一帧捕捉到的微弱信号“对齐”到一个标准的时空容器里。

2. 粒子滤波:处理不确定性的利器
面对极暗的信号,直接求解逆问题极其不稳定。作者引入了 粒子滤波 (Particle Filtering),它不给出一个确定的位置,而是维护一群“粒子”,每个粒子代表物体位置的一个假设。
- 传播:根据物理运动先验移动粒子。
- 评估:将粒子渲染为虚拟测量,对比真实接收到的微弱单光子信号,并评分。
- 重采样:留下评分高的,淘汰评分低的。
实验战绩:让隐形物体成为导航路标
研究展示了三个令人振奋的应用场景:
- 3D 追踪:即便目标在视野外,误差也控制在 5 厘米以内。
- 多目标区分:即使两个物体同时在角落后移动,系统也能通过 K-means 聚类粒子群,准确识别出两个各异的轨迹。
- 相机本地化 (Localization):在面对白墙(无特征点)时,传统视觉算法会“致盲”,但通过观察角落后反射的信号,系统能利用隐藏物体作为“锚点”精准定位相机。

深度洞察:漫反射物体也能看清吗?
一个有趣的细节是,虽然该模型设计初衷是针对强反馈的逆反射(Retroreflective)物体,但作者在实验中展示了**漫反射(Diffuse)**物体的处理结果(图5)。尽管信噪比进一步下降,且存在非共聚焦路径的干扰,系统依然展现了极强的鲁棒性。

局限性与未来展望
- 物体形状先验:目前的追踪任务仍需要大致知晓物体的 3D 形状(Canonical STIR)。
- 计算代价:虽然实现了实时化,但在手机 SoC 上运行复杂的粒子滤波仍有优化空间。
总结:这项工作最伟大的意义在于**“民主化”**了 NLOS 成像。它预示着在不久的将来,扫地机器人能预知转角后的宠物,AR 眼镜能通过“偷看”身后的物体来校准位姿。
本文基于 arXiv 论文 《Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling》 撰写。
