Thinking with Visual Primitives:让 AI 像人一样“指着图”进行深度思考

Thinking with Visual Primitives

Ruijie Lu, Yiyang Ma, Xiaokang Chen, Lingxiao Luo, Zhiyu Wu, Zizheng Pan, Xingchao Liu, Yutong Lin, Hao Li, Wen Liu, Zhewen Hao, Xi Gao, Shaoheng Nie, Yixuan Wei, Zhenda Xie, Ting Chen, Gang Zeng
总结
问题
方法
结果
要点
摘要

DeepSeek 团队提出了 Thinking with Visual Primitives (TVP),这是一种新型的多模态大模型推理框架。该方法将点(Points)和边界框(Bounding Boxes)提升为“最小思维单元”,使模型在 Chain-of-Thought 推理过程中能直接交织空间参考,在空间推理和拓扑任务上达到了与 GPT-5.4 和 Claude-Sonnet-4.6 相当的 SOTA 水平。

TL;DR

DeepSeek 团队发布的这篇论文,通过将**点(Points)边界框(Boxes)**设计为推理链中的“最小思维单元”,有效解决了多模态大模型(MLLM)在复杂空间推理中的“参考间隙”问题。该模型不仅能够精准计数和推理空间关系,甚至展现出了破解复杂迷宫和追踪缠绕曲线的逻辑能力,其表现足以媲美甚至超越 GPT-5.4 等顶尖闭源模型。

1. 痛点:看得清,不代表想得明白

在 MLLM 领域,人们一直致力于解决“感知间隙(Perception Gap)”,即通过提高分辨率让模型看清细节。然而,DeepSeek 的研究者发现,即使模型看清了每一个像素,它们在处理诸如“数一下这堆糖果里有多少个红色”或“这条线通往哪里”的任务时,依然会胡言乱语。

这就是参考间隙(Reference Gap)

  • 语言的无力感:用纯文字描述复杂的空间位置非常低效且容易产生歧义。
  • 逻辑链脱节:在多步推理中,模型容易在思维过程中“跟丢”它正在讨论的视觉对象。

2. 核心机制:将坐标作为“思维基元”

作者的灵感源于人类:当我们数数或走迷宫时,手指会自然地指点。TVP 框架将这种“点对点推理”内化到了模型中。

2.1 架构革新:极致压缩

模型基于 DeepSeek-V4-Flash 架构,采用 Compressed Sparse Attention (CSA) 机制。

  • 惊人的效率:从原始像素到最终 LLM 推理时的 KV Cache,实现了 7056倍 的压缩比。
  • Token 节省:仅需极少量的 Visual Token 即可维持高质量的认知深度,这为长上下文推理提供了巨大优势。

2.2 推理范式:Interleaved Thinking

模型产生的不仅仅是文字,而是文字与坐标的交织体: Thinking: 首先,我定位到... <|ref|>目标对象<|/ref|><|box|>[[x,y,x,y]]<|/box|>,接着根据它的位置...

模型架构与训练流程

3. 被“冷启动”唤醒的特殊能力

为了训练这种能力,团队构建了四大类极具挑战性的训练任务:

  1. 密集计数:通过 Box 锚点避免重复计算。
  2. 空间推理:解决多步逻辑关联(Multi-hop Reasoning)。
  3. 迷宫导航:利用 DFS 思想在迷宫中进行点对点路径搜索。
  4. 路径追踪:在高度缠绕的线条中识别唯一的通路。

计数任务示例

4. 实验结果:拓扑推理的新高度

实验显示,TVP 在传统的 VQA 任务上略胜一筹,但在涉及“拓扑推理”的任务中简直是降维打击。

任务 (Metric)Gemini-3-FlashGPT-5.4Ours (DeepSeek)
迷宫导航 (ACC)49.450.666.9
路径追踪 (ACC)41.446.556.7

这种提升证明了:引入空间坐标作为思维媒介,赋予了模型原本不具备的、类似 System-2 的逻辑严密性。

迷宫与路径追踪结果

5. 深度洞察与总结

DeepSeek 的这项工作标志着 MLLM 从“看图说话”向“看图逻辑思考”的重要转型。

  • 核心贡献:打破了纯语言 Chain-of-Thought 的局限性,将坐标系统合法的引入了 LLM 的推理空间。
  • 局限性:目前这种“思维基元”模式仍需要特定的触发词引导,未来若能实现自动触发将更具威力。
  • 启示:未来的多模态 AI,不仅需要更敏锐的眼睛,更需要一种能将“所见”与“所思”精确对应起来的底层架构。

本文主编评论:DeepSeek 再次用极高的工程效率和深刻的物理直觉证明,有时候改进模型思维逻辑的收益,远大于单纯堆叠数据和分辨率。

发现相似论文

试试这些示例

  • 查找最近其他尝试将空间坐标或 Bounding Box 整合进大语言模型 Chain-of-Thought 推理过程的研究。
  • 哪篇论文最早讨论了多模态模型中的“Reference Gap”或参考歧义性问题,本文提出的 Visual Primitives 与其有何渊源?
  • 有哪些研究探讨了将点和框等视觉基元应用到具身智能(Embodied AI)或机器人导航逻辑推理中?
目录
Thinking with Visual Primitives:让 AI 像人一样“指着图”进行深度思考
1. TL;DR
2. 1. 痛点:看得清,不代表想得明白
3. 2. 核心机制:将坐标作为“思维基元”
3.1. 2.1 架构革新:极致压缩
3.2. 2.2 推理范式:Interleaved Thinking
4. 3. 被“冷启动”唤醒的特殊能力
5. 4. 实验结果:拓扑推理的新高度
6. 5. 深度洞察与总结