[CVPR 2026] 想象力有助于视觉推理,但潜空间可能只是个“幻觉”
Imagination Helps Visual Reasoning, But Not Yet in Latent Space
本文通过因果中介分析(Causal Mediation Analysis)对潜空间视觉推理(Latent Visual Reasoning, LVR)进行了深度解构。研究发现当前的 LVR 方法中潜标记(Latent Tokens)与输入和输出均存在严重的“断连”,并据此提出了基于显式文本想象的方法 CapImagine,在多个视觉基准测试中显著超越了潜空间 SOTA 模型(如 Monet)。
TL;DR
长期以来,学术界普遍认为在多模态大模型(MLLM)的隐藏层(Latent Space)进行推理是实现“人类般想象力”的捷径。然而,本文通过因果中介分析(Causal Mediation Analysis)拆穿了这个美好的愿景:当前的潜空间标记(Latent Tokens)既不反映输入的变化,也不真正决策输出。作者由此转向显式的文本空间想象(CapImagine),在性能上全方位碾压了现有的潜空间 SOTA 方法。
背景定位:潜空间推理的“皇帝新衣”
在视觉推理领域,Latent Visual Reasoning (LVR) 一直被视为高端玩家的选择。相比于僵硬的工具调用,LVR 试图通过模型内部的隐藏状态来编码视觉信息。然而,本文作者敏锐地察觉到,虽然这类模型在榜单上表现不错,但没有人能解释那些神秘的 Latent Token 到底在想什么。
痛点深挖:两大断连现象
作者将推理过程建模为因果链:。通过大规模实验,发现了两个令人震惊的结论:
- Input-Latent Disconnect:无论你给模型看什么图、问什么问题,生成的潜标记相似度极高。这意味着模型在潜空间里几乎在“念经”,根本没看输入。
- Latent-Answer Disconnect:即使你把潜标记换成随机高斯噪声,或者直接抹除,模型的最终准确率波动极小。这证明了潜标记对结果几乎没有因果贡献。

核心方法:CapImagine —— 回归文本的魅力
既然潜空间靠不住,作者干脆反其道而行之:让模型用嘴说出它的想象。
1. 数据重写 (Data Rewriting)
作者并没有寻找新数据,而是将现有的潜空间训练集(如 Monet-SFT-125K)进行了文本化改造。利用 Qwen3-VL 将中间的图像操作(如“放大左上角区域”)转化为精炼的视觉文本描述。
2. 显式因果链
在 CapImagine 中,推理链变成了:。由于文本具有天然的可解释性,模型被迫在文本空间内建立起从视觉观察到逻辑判断的显式联系。

实验与结果:全线 SOTA
CapImagine 在多项高密度感知指标上表现优异:
- HR-Bench-8K: 相比 Monet 提升了 4.0%。
- MME-RealWorld-Lite: 提升了 4.9%。
- 因果依赖实验: 当对 CapImagine 的文本想象内容进行干预(do(Z))时,模型的性能发生了断崖式下跌。这种“脆弱性”反而证明了文本推理链的真实有效性——因为它真的在参与决策。

深度洞察:为什么潜空间失败了?
作者在消融实验中指出,当前的潜空间方法(如 Monet, LVR)往往将潜标记作为一种“软提示(Soft Prompt)”或“占位符”。由于缺乏足够强的语义约束,这些标记最终发生了模式崩溃(Mode Collapse)。相比之下,文本作为一种高度压缩且语义明确的符号系统,目前依然是复杂推理的最优载体。
局限性与展望
虽然 CapImagine 效果拔群,但它也存在副作用:推理延迟增加。因为生成文本比生成潜标记要慢。作者坦言,高维潜空间理论上拥有比文字更大的信息容量,未来的挑战在于:如何给潜空间加上“因果紧箍咒”,让它像文字一样逻辑严密,同时保持向量的高效。
总结: 这项研究给火热的“潜空间推理”泼了一盆冷水,提醒我们:如果一个推理过程不可解释、不可干预,那么它极有可能只是模型在走捷径。
