[arXiv 2025] NV-CoT:让多模态模型拥有“连续”的视觉思维能力
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
本文提出了 Numerical Visual Chain-of-Thought (NV-CoT),这是一种将多模态大语言模型(MLLM)的动作空间从离散文本 Token 扩展到连续欧几里得空间的框架。该方法允许模型直接输出连续的数值坐标作为 Bounding-box,在 V* Bench 等基准测试中显著提升了定位精度和推理准确率。
TL;DR
传统的视觉思维链(Visual CoT)让模型像写作文一样“写”出坐标,这既不精确也不直观。NV-CoT 突破了这一局限,它通过扩展 MLLM 的动作空间,让模型直接在连续的欧几里得空间内“定位”目标。这种方法不仅显著提升了定位精度(IoU 提升 12%+),还能无缝接入 GRPO 强化学习框架,在多项视觉推理榜单上刷新了 SOTA。
痛点深挖:为什么“文本化坐标”是死胡同?
在之前的 Visual CoT 研究中,当模型想要查看图片的某个局部时,通常会输出类似 [31, 45, 120, 200] 的文本字符串。这种做法看似简单,实则隐藏着两个致命伤:
- 几何感知缺失 (Modality Mismatch):在文本 Token 空间里,“3.1”和“3.2”只是两个不同的 ID。如果真实值是“3.1”,模型预测出“3.2”和预测出“9.9”在 Cross-Entropy 损失函数看来惩罚是类似的,这完全无视了物理空间的距离感。
- 语义碎片化 (Semantic Fragmentation):数字被拆解为子词(Sub-tokens),导致模型在处理“3.11”和“3.9”谁大谁小时经常产生幻觉。
相比之下,虽然有些方法尝试直接操作 Visual Patches,但又被困在了视觉主干网络固定的网格里。
核心方法:向连续动作空间进军
NV-CoT 的核心思想非常优雅:将坐标视为连续动作(Continuous Actions)。
1. 架构改造
作者并没有动 LLM 的核心,而是在输出层增加了 5 个轻量级的线性 Head:
- (Mean):4 个输出,直接回归 Bounding-box 的坐标 。
- (Dispersion):预测预测的不确定性(方差)。
2. 连续策略下的强化学习
这是本文最具技术含量的地方。要在不依赖坐标标注的情况下进行强化学习(如 GRPO),必须解决随机采样设计:
- 随机策略构建:模型不再输出确定的 Token,而是输出一个高斯分布 或拉普拉斯分布。
- 重参数化采样:利用 ,使得梯度可以穿透采样过程。
- 闭式解析解:作者推导了高斯和拉普拉斯分布下重要性采样比(Importance Ratio)和 KL 散度的解析解,让模型可以直接使用 GRPO 进行结果导向的强化学习。
图 1:文本驱动 vs. Patch 驱动 vs. NV-CoT 的动作空间对比
实验战绩:精度与速度的双重飞跃
实验结果证明了“连续性”的威力:
- 定位更精准:通过可视化可以看到,相比于基线方案(蓝色框),NV-CoT(红色框)生成的边界框更加紧凑,完美贴合目标边缘。
- 推理更聪明:在需要精细感知的 HR-Bench(4K/8K 高分辨率基准)上,7B 规模的 NV-CoT 甚至超过了 32B 的 Qwen2.5-VL,这说明高效的局部定位比堆参数量更管用。
- 收敛更快速:由于回归损失比分类损失更具方向性,模型的训练速度显著提升。
图 2:定位精度与最终答案准确率的训练曲线对比
深度洞察:回归 Loss 的“玄学”选择
论文中一个有趣的消融实验是关于 L1 (Laplace) vs L2 (Gaussian) 的选择。在目标检测领域,Smooth L1 通常被认为比 L2 更稳健。本文在 RL 框架下再次验证了这一点:拉普拉斯策略在所有基准测试中均优于高斯策略。这提示我们,在处理具有长尾噪声的视觉定位任务时,拉普拉斯分布对离群点的容忍度提供了更好的归纳偏置(Inductive Bias)。
总结与局限
NV-CoT 成功地为 MLLM 装备了一把精准的“视觉手术刀”。它的意义不仅在于刷榜,更在于验证了 LLM 可以通过极小的代价(几个线性层)实现跨模态动作空间的对齐。
局限性:尽管定位精准,但目前该方法仍依赖于“Zoom-in”这一预设工具。未来如何让模型自主学习更多样化的连续动作(如连续的旋转、画笔轨迹等),将是一个极具潜力的研究方向。
