Thinking with Spatial Code:突破感知瓶颈,赋予 LLM 物理世界的 3D 直觉

Thinking with Spatial Code for Physical-World Video Reasoning

总结
问题
方法
结果
要点
摘要

本文提出了 Thinking with Spatial Code 框架,一种将 RGB 视频转化为显式、时空一致的 3D 空间代码(Spatial Code)以进行物理世界视频问答的方法。该框架通过一个统一语义与几何特征的 Spatial Encoder 将视频解析为包含 3D 框和语义标签的结构化代码,并利用强化学习(RL)优化 LLM 的坐标推理能力,在 VSI-Bench 上刷新了 SOTA 成就。

TL;DR

约翰霍普金斯大学与斯坦福大学的研究团队发布了 Thinking with Spatial Code。不同于主流模型直接对视频像素进行推理,该框架先将视频“解析”为一组包含 3D 坐标、尺寸和朝向的结构化代码(Spatial Code),再交由 LLM 进行数理逻辑推理。在 VSI-Bench 物理空间推理榜单上,仅 4B 规模的模型便击败了 GPT-5o 和 Gemini-2.5,证明了 “显式 3D 架构比模型规模更重要” 的核心论点。


1. 痛点:为什么 LLM 是“路痴”?

即便当前最强的 MLLMs(如 GPT-4o)能识别视频里的沙发和桌子,它们在面对诸如“如果我站在洗碗机旁面向桌子,洗衣机在我的左后方吗?”这类问题时往往表现惨淡。

本质原因有二:

  • 缺乏 3D 一致性:模型只能看到 2D 像素,难以还原物体在 3D 空间中的度量关系(Metric Structure)。
  • 推理与行动脱节 (Reasoning-Action Disconnect):模型可能在推理链(CoT)中正确分析了空间关系,但在输出最终选项时由于缺乏几何约束而选错。

2. 核心方法:像工程师一样看世界

2.1 Spatial Encoder:从视频到 3D 结构化语义

作者提出了一个强大的感知模块,它不再输出模糊的特征向量,而是输出符号化的 3D 信息

  • 双编码器设计:整合 SAM-2(负责物体追踪与语义特征)和 Depth Anything 3(负责提供密集的几何线索)。
  • 3D Detection Head:不仅确定物体的 3D 框(Bounding Box),还预测其旋转分量(四元数形态)。
  • 多帧融合:通过相机位姿变换,将每一帧的局部探测结果合并到全局坐标系下,消除时空不一致现象。

模型架构图 图 1:Thinking with Spatial Code 整体框架。视频被转化为显式的空间代码,随后输入 LLM 进行推理。

2.2 空间准则奖励(Spatial Rubric Reward)

为了让 LLM 学会真正的“空间思维”,作者在强化学习阶段弃用了单纯的结果验证(Outcome-based),引入了过程监督(Process Supervision)

  • 视角感知奖励:如果模型在推理中显式构建了局部坐标系(而非混淆世界坐标系),给予正向奖励。
  • 朝向意识奖励:惩罚忽略物体 Yaw 角(偏航角)的推理逻辑。
  • 反“幸运猜测”:如果模型最终答案正确但推理步骤逻辑混乱,会被扣分。

3. 实验战绩:规模不是万能药

VSI-Bench 测试中,该框架的表现令人侧目:

  • 4B 模型 vs. 230B 巨兽:搭载 Spatial Code 的 4B Qwen 衍生模型在平均分上优于拥有数千亿参数的 Seed-1.6。
  • 超越闭源模型:在提供 2D 框辅助时,其准确率达到 60.0%,显著高于 GPT-5o (55.0%)。

实验结果对比 表 1:在 VSI-Bench 上各模型的性能对比,展现了框架在复杂空间推理任务中的优势。


4. 深度洞察:感知质量是上限,推理是下限

本文最具影响力的发现是:空间推理的表现主要由 3D 感知质量决定,而非 LLM 的逻辑能力。

作者做了一个极具启发性的实验:

  • 使用 预测的空间代码,模型得分约 60%
  • 换成 真值 (Ground-Truth) 空间代码,模型得分立即飙升至 73.2%

这表明,即便是小参数量的 LLM,只要喂给它准确的几何事实,它就能完成高难度的物理推理。目前的瓶颈不在于 LLM 不聪明,而在于“视力”不够好,无法从像素中提取高质量的空间逻辑变量。


5. 局限性与未来

尽管该方法在精度上领先,但其依赖于复杂的感知流水线(Pipeline),推理延迟会高于端到端的模型。此外,物体旋转的精确预测在极端遮挡下仍具备挑战性。

总结 (Takeaway): Think-with-Spatial-Code 重新审视了“视觉即逆图形学”的价值。在通用多模态模型试图通过单纯堆叠参数解决一切的今天,这项工作提醒我们:显式的物理表征仍然是连接计算机视觉与物理世界推理最可靠的桥梁。

发现相似论文

试试这些示例

  • 查找最近其他尝试将三维几何信息(如 Depth map 或 3D Bounding Box)作为中间表示集成到大语言模型视频推理任务中的论文。
  • 哪篇论文最早在视觉问答中提出了“视觉即逆图形学”(Vision as Inverse Graphics)的理论框架,本文在这一思想上有哪些具体的工程改进?
  • 寻找将这种结构化空间代码(Spatial Code)应用到机器人操作(Robot Manipulation)或具身智能导航任务中的相关研究。
目录
Thinking with Spatial Code:突破感知瓶颈,赋予 LLM 物理世界的 3D 直觉
1. TL;DR
2. 1. 痛点:为什么 LLM 是“路痴”?
3. 2. 核心方法:像工程师一样看世界
3.1. 2.1 Spatial Encoder:从视频到 3D 结构化语义
3.2. 2.2 空间准则奖励(Spatial Rubric Reward)
4. 3. 实验战绩:规模不是万能药
5. 4. 深度洞察:感知质量是上限,推理是下限
6. 5. 局限性与未来