[ICLR 2026] MLLM-4D:赋予大模型 4D 时空感知与物理推理之魂

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

总结
问题
方法
结果
要点
摘要

本文提出了 MLLM-4D,这是一个旨在提升多模态大模型(MLLM)4D 时空智能的综合框架。通过自动化数据清洗管线和层次化后训练策略(SFT + RFT),模型能够仅凭 2D 视频输入实现对 3D 空间随时间演变的感知与推理,并在 MLLM4D-Bench 等多个基准测试中达到 SOTA 水平。

TL;DR

人类天生具备 4D 时空智能,能从 2D 视觉中脑补出 3D 空间随时间的变化。然而,目前的 MLLM 在这方面表现不佳。MLLM-4D 通过一套自动化的“立体视频转 4D 指令”管线,构建了包含 200 万条数据的 MLLM4D-2M,并配合 ST-CoT(时空思维链)和 ST-reward(物理一致性奖励),成功让标准架构的多模态大模型在不增加额外插件的情况下,实现了对动态场景的深度物理理解。

1. 痛点:被困在 2D 或静态 3D 中的大模型

目前的 MLLM 研究主要集中在静态图像的 3D 改良上,通过添加额外的 Point Cloud 编码器来理解空间。但在现实世界中,相机在动,物体也在动。现有的方法面对动态视频时往往会产生“幻觉”,无法准确计算物体间的物理距离或相机的运动轨迹。

造成这一困境的核心原因有二:

  1. 数据荒:高质量的 4D 标注极难获取,人工标注不仅昂贵且难以精确到物理尺度(如:物体确切移动了多少米)。
  2. 物理直觉缺失:模型通常只进行像素级的模式匹配,而不理解物体在三维空间中的物理演化逻辑。

2. 核心突破:从立体视频中“炼金” 4D 数据

为了解决数据问题,作者巧妙地回避了成本高昂的人工标注,开发了一套 自动化数据管线

  • 原理:利用 Stereo(立体)视频数据集自带的深度感,结合 SfM (Structure-from-Motion) 算法提取相机姿态,使用 GroundedSAM2 进行物体跟踪,并通过飞物理公式直接算出物体移动的“真值”(Ground Truth)。
  • 产出:MLLM4D-2M(用于 SFT)和 MLLM4D-R1-30k(用于强化学习),覆盖了相机自运动、独立物体运动、人机动态交互等六大复杂维度。

数据生成管线 图 1:MLLM-4D 的自动化数据固化管线,利用物理引擎生成点云和相机轨迹真值。

3. 训练策略:让模型像物理引擎一样思考 (ST-CoT)

作者认为,单纯的 QA 训练不够,必须让模型学习“推理过程”。为此,他们定义了 Spatiotemporal Chain of Thought (ST-CoT),要求模型在回答前必须按五个步骤分析:

  1. 时间锚定:锁定起止帧。
  2. 初始状态解析:解析起始帧的 3D 位置。
  3. 视觉线索收集:通过视角畸变等推测运动增量。
  4. 末帧状态验证:检查轨迹逻辑是否闭环。
  5. 证据合成:推导出最终答案。

为了强制模型遵守这套物理逻辑,作者引入了 ST-reward (时空奖励)。在 GRPO 强化学习过程中,如果模型推理出的物体中心坐标或相机坐标与物理真值偏差过大,就会受到惩罚。

强化学习流程 图 2:基于 GRPO 的强化学习流程,结合 ST-CoT 和 ST-reward 确保物理一致性。

4. 实验战绩:全方位碾压

在作者提出的 MLLM4D-Bench 及业界公认的 VLM4D 基准上,MLLM-4D 表现惊人:

  • 在相机绝对距离预测、物体运动方向判断等任务上,平均分 (72.7%) 远超 GPT-4o 和 Gemini 2.5 Pro
  • 相比基线模型 Qwen3-VL,经过 4D 强化的版本在动态场景下的表现提升了近一倍。

性能对比表 图 3:MLLM4D-Bench 实验结果,MLLM-4D 在多项时空理解指标上大幅领先。

5. 总结与深度洞察

MLLM-4D 的成功向外传递了一个重要信号:多模态大模型的空间智能,关键在于训练数据的“物理化”和推理过程的“结构化”

  • 优势:它摆脱了对昂贵激光雷达 (LiDAR) 数据或 3D 插件的依赖,仅靠 RGB 视频就展现出了极强的 4D 模型推演能力。
  • 局限:目前受限于 Tranformer 的上下文窗口,处理长时长视频仍有挑战(依赖采样);此外,预测出的具体米数虽好,但在极端遮挡情况下的鲁棒性仍需检验。

对于具身智能(Embodied AI)开发者来说,MLLM-4D 提供了一个极具价值的范式:通过 R1 风格的强化学习,将物理反馈引入大模型,让 AI 真正“看懂”世界的运行规律。

发现相似论文

试试这些示例

  • 查找最近其他尝试将立体视觉 (Stereoscopic Vision) 转换为多模态大模型训练数据的相关研究。
  • 哪篇论文最早在多模态模型中应用了 Group Relative Policy Optimization (GRPO),本文的 ST-reward 如何改进了该算法的奖励机制?
  • 有哪些研究正探索将 4D 时空推理能力应用到自动驾驶或具身智能机器人的决策任务中?
目录
[ICLR 2026] MLLM-4D:赋予大模型 4D 时空感知与物理推理之魂
1. TL;DR
2. 1. 痛点:被困在 2D 或静态 3D 中的大模型
3. 2. 核心突破:从立体视频中“炼金” 4D 数据
4. 3. 训练策略:让模型像物理引擎一样思考 (ST-CoT)
5. 4. 实验战绩:全方位碾压
6. 5. 总结与深度洞察