[arXiv 2025] NV-CoT:让多模态模型拥有“连续”的视觉思维能力

Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought

总结
问题
方法
结果
要点
摘要

本文提出了 Numerical Visual Chain-of-Thought (NV-CoT),这是一种将多模态大语言模型(MLLM)的动作空间从离散文本 Token 扩展到连续欧几里得空间的框架。该方法允许模型直接输出连续的数值坐标作为 Bounding-box,在 V* Bench 等基准测试中显著提升了定位精度和推理准确率。

TL;DR

传统的视觉思维链(Visual CoT)让模型像写作文一样“写”出坐标,这既不精确也不直观。NV-CoT 突破了这一局限,它通过扩展 MLLM 的动作空间,让模型直接在连续的欧几里得空间内“定位”目标。这种方法不仅显著提升了定位精度(IoU 提升 12%+),还能无缝接入 GRPO 强化学习框架,在多项视觉推理榜单上刷新了 SOTA。

痛点深挖:为什么“文本化坐标”是死胡同?

在之前的 Visual CoT 研究中,当模型想要查看图片的某个局部时,通常会输出类似 [31, 45, 120, 200] 的文本字符串。这种做法看似简单,实则隐藏着两个致命伤:

  1. 几何感知缺失 (Modality Mismatch):在文本 Token 空间里,“3.1”和“3.2”只是两个不同的 ID。如果真实值是“3.1”,模型预测出“3.2”和预测出“9.9”在 Cross-Entropy 损失函数看来惩罚是类似的,这完全无视了物理空间的距离感。
  2. 语义碎片化 (Semantic Fragmentation):数字被拆解为子词(Sub-tokens),导致模型在处理“3.11”和“3.9”谁大谁小时经常产生幻觉。

相比之下,虽然有些方法尝试直接操作 Visual Patches,但又被困在了视觉主干网络固定的网格里。

核心方法:向连续动作空间进军

NV-CoT 的核心思想非常优雅:将坐标视为连续动作(Continuous Actions)

1. 架构改造

作者并没有动 LLM 的核心,而是在输出层增加了 5 个轻量级的线性 Head:

  • (Mean):4 个输出,直接回归 Bounding-box 的坐标
  • (Dispersion):预测预测的不确定性(方差)。

2. 连续策略下的强化学习

这是本文最具技术含量的地方。要在不依赖坐标标注的情况下进行强化学习(如 GRPO),必须解决随机采样设计:

  • 随机策略构建:模型不再输出确定的 Token,而是输出一个高斯分布 或拉普拉斯分布。
  • 重参数化采样:利用 ,使得梯度可以穿透采样过程。
  • 闭式解析解:作者推导了高斯和拉普拉斯分布下重要性采样比(Importance Ratio)和 KL 散度的解析解,让模型可以直接使用 GRPO 进行结果导向的强化学习。

模型架构图对比 图 1:文本驱动 vs. Patch 驱动 vs. NV-CoT 的动作空间对比

实验战绩:精度与速度的双重飞跃

实验结果证明了“连续性”的威力:

  • 定位更精准:通过可视化可以看到,相比于基线方案(蓝色框),NV-CoT(红色框)生成的边界框更加紧凑,完美贴合目标边缘。
  • 推理更聪明:在需要精细感知的 HR-Bench(4K/8K 高分辨率基准)上,7B 规模的 NV-CoT 甚至超过了 32B 的 Qwen2.5-VL,这说明高效的局部定位比堆参数量更管用。
  • 收敛更快速:由于回归损失比分类损失更具方向性,模型的训练速度显著提升。

实验结果对比 图 2:定位精度与最终答案准确率的训练曲线对比

深度洞察:回归 Loss 的“玄学”选择

论文中一个有趣的消融实验是关于 L1 (Laplace) vs L2 (Gaussian) 的选择。在目标检测领域,Smooth L1 通常被认为比 L2 更稳健。本文在 RL 框架下再次验证了这一点:拉普拉斯策略在所有基准测试中均优于高斯策略。这提示我们,在处理具有长尾噪声的视觉定位任务时,拉普拉斯分布对离群点的容忍度提供了更好的归纳偏置(Inductive Bias)。

总结与局限

NV-CoT 成功地为 MLLM 装备了一把精准的“视觉手术刀”。它的意义不仅在于刷榜,更在于验证了 LLM 可以通过极小的代价(几个线性层)实现跨模态动作空间的对齐

局限性:尽管定位精准,但目前该方法仍依赖于“Zoom-in”这一预设工具。未来如何让模型自主学习更多样化的连续动作(如连续的旋转、画笔轨迹等),将是一个极具潜力的研究方向。

发现相似论文

试试这些示例

  • 查找最近其他尝试将大语言模型的输出空间从离散 Token 扩展到连续数值或动作空间的研究论文。
  • 哪篇论文最早将强化学习中的高斯策略应用于 Transformer 架构,本文在实现 GRPO 兼容性上做了哪些关键改进?
  • 有哪些研究探讨了在多模态任务中,使用拉普拉斯分布(L1 损失)替代高斯分布(L2 损失)对定位精度的影响?
目录
[arXiv 2025] NV-CoT:让多模态模型拥有“连续”的视觉思维能力
1. TL;DR
2. 痛点深挖:为什么“文本化坐标”是死胡同?
3. 核心方法:向连续动作空间进军
3.1. 1. 架构改造
3.2. 2. 连续策略下的强化学习
4. 实验战绩:精度与速度的双重飞跃
5. 深度洞察:回归 Loss 的“玄学”选择
6. 总结与局限