[CVPR 2024] tttLRM:基于测试时训练的长上下文自回归 3D 重建新范式
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
tttLRM 是一种基于测试时训练(Test-Time Training, TTT)的新型 3D 大模型,实现了长上下文、自回归的 3D 重建。通过引入具有线性复杂度的 LaCT 层,该方法能将多视图观测高效压缩为隐式状态并解码为 3D Gaussian Splatting (3DGS),在处理多达 64 帧的高分辨率场景重建中达到 SOTA 水平。
TL;DR
tttLRM 是一项突破性的 3D 视觉工作,它通过将 Test-Time Training (TTT) 引入大重建模型(LRM),首次实现了具有线性计算复杂度的长序列、自回归 3D 重建。该模型能将 64 帧甚至更多的高清影像流式压缩进神经网络的“快速权重”中,并实时解码为高精度 3D Gaussian Splatting(3DGS),彻底解决了传统模型在处理长上下文时的显存爆炸问题。
背景定位
在 3D 重建领域,LRM(Large Reconstruction Models)通常采用 Transformer 架构。然而,Self-Attention 的二次方复杂度()使得模型在面临来自视频流的长序列观测时显得力不从心。tttLRM 的核心直觉在于:重建本质上是模型对观测数据的在线学习过程。通过将网络权重作为“隐式存储器”,它成功地将 3D 信息的存储与推理复杂度解耦。
核心动机:为何需要 TTT?
人类感知世界是流式的、增量的。我们需要一种能够:
- 长上下文支持:不仅仅是 4 帧或 32 帧,而是处理数百帧的无限流。
- 实时自回归:随着观察的深入,3D 内部表示应自动细化(Refinement)。
- 效率与显存友好:复杂度必须是线性的。
方法论详解:LaCT 与快速权重的妙用
tttLRM 的核心是 LaCT (Large Chunk Test-Time Training) 模块。不同于传统的 KV Cache 存储,tttLRM 将输入 Patch 视为微型数据集,通过梯度下降更新 LaCT 层内的“快速权重” 。
1. 架构流转
如图所示,模型接收带位姿的多视图图像,编码为 Visual Tokens:
- 更新阶段 (Update):Tokens 输入 LaCT 块,通过在线优化(Muon 优化器)更新权重 。
- 查询阶段 (Apply):使用一组虚拟 Query Tokens(如预设的平面向量)去访问这些权重,提取隐式存储的几何与颜色特征。
- 解码阶段:将查询出的特征解码为 3DGS 参数(位置、旋转、缩放、不透明度)。

2. 分布式序列并行
为了处理超长序列,作者引入了序列并行机制。将不同的视图分发到多个 GPU,各 GPU 独立更新并同步快速权重的梯度,从而支持百万量级 Tokens 的场景训练。
实验战绩与结果分析
1. 场景重建的跨代提升
在 DL3DV 数据集上,tttLRM 展现了惊人的泛化性。相比于需要数分钟优化的传统 3DGS,tttLRM 仅需数秒即可完成推理,且 PSNR 显著高于以往的 Feed-forward 基线 Long-LRM。

2. 自回归的“进化”之路
模型支持流式输入。实验显示,当输入从 4 帧增加到 32 帧时,同一区域的渲染细节在不断修正和完善,这为移动机器人或 AR 设备的实时建模提供了可能。
3. 多样化的输出格式
除了 3DGS,tttLRM 的隐式存储同样可以解码为 Triplane-NeRF。这意味着其学到的“快速权重”是一种通用的 3D 几何特征表示。

深度洞察与总结
核心价值:tttLRM 成功将 3D 重建从“全局特征聚合”转化为“参数在线优化”。这种思维转变利用了线性注意力和 TTT 的优势,弥补了隐式场复杂性高与显式场插值难之间的鸿沟。
局限性:由于快速权重 的参数量是固定的,对于极其复杂的庞大场景可能存在“存储拥堵”现象。未来的研究可能会集中在动态扩展神经网络存储容量,以支持更大尺度的城市级重建。
展望:随着高质量流式数据的普及,tttLRM 这种具备“短期记忆”能力的网络可能是通往 3D 世界模型(World Models)的关键技术路径之一。
