Visual Latents Know More Than They Say:唤醒 MLLM 中被抑制的潜空间推理能力

Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

总结
问题
方法
结果
要点
摘要

本文提出了针对多模态大模型(MLLM)的推断期潜在推理框架,通过解决“Silenced Visual Latents”现象,无需更新主干网络参数即可提升推理能力。该方法由查询引导的对比潜空间对齐(Stage I)和奖励驱动的连续推理强化(Stage II)组成,在多个 SOTA 后端模型上实现了显著的视觉推理性能提升。

TL;DR

在多模态推理中,我们习惯让模型一边学习视觉潜变量(Latent),一边预测答案。但本文揭示了一个扎心的事实:由于大模型太“聪明”,它在训练中学会了绕过复杂的潜变量推理,直接从原始视觉输入中通过快捷路径寻找答案,导致昂贵的潜变量被“静默”(Silenced)。本文提出了一种无需微调参数、仅在推断期通过对比热身和奖励强化来唤醒这些潜变量的方法,在 IQ 测试和数学推理等硬核任务上刷新了纪录。

痛点深挖:被“静默”的视觉潜变量

目前的多模态模型(MLLM)通常将中间推理过程从离散的文本 Token 转移到连续的潜空间(Latent Space),以获得更高的表征带宽。然而,作者通过实验发现,虽然潜变量在训练中变得越来越能代表视觉特征,但模型的最终准确率却并未随之稳步提升。

本质原因(Insight):在共享参数空间的训练中,自回归预测的损失函数(Loss)倾向于选择“阻力最小”的路径。比起通过深层的潜变量转换,直接从原始 Visual Input 中提取特征更简单,导致潜变量在优化过程中变成了类似于“分隔符”的无效 Token。

物理直觉:联合优化的困境 图 1:联合优化蓝图——左侧的自回归目标与右侧的视觉推理目标存在冲突,潜变量被迫处于中庸的静默状态。

核心方法:两阶段解耦优化

为了打破这种僵局,本文提出了在推断阶段(Inference-time)独立优化潜变量的方案,而保持模型主干(Backbone)冻结。

Stage I:查询引导的对比预热 (Visual Latent Warm-up)

作者认为潜变量不应该只是视觉特征的堆砌,而应该是关联问题的。

  • 对比学习:利用 Attention 图提取与 Query 相关性最高的视觉块作为正样本,无关块作为负样本。
  • 块状分配:为了防止多个潜变量 Token 退化(Collapse)成同一个特征,模型将视觉块划分为不重叠的小组,强迫每个潜变量 Token 关注不同的视觉细节。

Stage II:置信度递进奖励强化 (Latent-to-Answer Reinforcement)

即便潜变量有了语义,模型如果不去“读”它也是徒劳。

  • 逻辑链条直觉:正如人类推理越来越清晰,潜变量序列末端的 Token 预测分布应该比前端更集中(更确信)。
  • 奖励设计:引入 Confidence-progression Reward,通过 NES 梯度估计器调整潜变量,使得 Top-δ 熵呈现下降趋势,强迫模型预测必须穿过(Route through)潜变量链条。

整体架构图 图 2:框架总览——从 Stage I 的语义对齐到 Stage II 的利用率强化。

实验战绩与 SOTA 对比

在 Qwen2.5-VL 等最强底座上的实验表明,该方法在需要精细观察的视觉任务上表现极佳:

  • 感知能力:在 Count(计数)和 IQTest(图形逻辑)上,性能提升分别达 +3.33% 和 +8.66%。
  • 模型通用性:在不同尺寸(3B, 7B)以及不同架构(R1-OneVision)上均展现出了稳健的泛化能力。

实验结果看板 表 1:在多项 Benchmark 上的量化对比。

深度洞察:为什么这种方法更高效?

相较于通过文本 CoT 增加数以百计的 Token 长度,本文仅使用极短的潜变量(如 K=4)就达到了更优的推理效果。计算得出的 Efficiency Ratio 显示,该方法在单位 Token 带来的性能收益上远超传统的文本推理和现有的潜空间方法。

总结与未来展望

核心贡献

  1. 首次界定了 Silenced Visual Latents 这一优化病理。
  2. 证明了通过纯数学优化方式(无梯度反传至模型)即可解锁闭源/冻结模型的推理潜力。

局限性: 每单次推理都需要额外的计算步骤来进行潜变量优化,这在实时响应场景中存在成本权衡。未来如何将这种推断期的增益低成本地“蒸馏”回模型参数中,将是极具价值的研究方向。

发现相似论文

试试这些示例

  • 查找在多模态语言模型中处理自回归任务捷径偏好(Shortcut Reliance)的其他最新研究方案。
  • 哪篇论文最早在大型语言模型中引入了连续潜空间推理(Latent Reasoning)的概念,其与本文的推断期优化有何异同?
  • 调研目前有哪些研究将这种推断期潜变量优化技术应用到了视觉步进推理或体感智能(Embodied AI)任务中?
目录
Visual Latents Know More Than They Say:唤醒 MLLM 中被抑制的潜空间推理能力
1. TL;DR
2. 痛点深挖:被“静默”的视觉潜变量
3. 核心方法:两阶段解耦优化
3.1. Stage I:查询引导的对比预热 (Visual Latent Warm-up)
3.2. Stage II:置信度递进奖励强化 (Latent-to-Answer Reinforcement)
4. 实验战绩与 SOTA 对比
4.1. 深度洞察:为什么这种方法更高效?
5. 总结与未来展望