[CVPR 2026] CrystaL:无需外部模态,MLLM 隐空间内自发涌现的视觉“结晶”推理

CrystaL: Spontaneous Emergence of Visual Latents in MLLMs

总结
问题
方法
结果
要点
摘要

本文提出了 CrystaL (Crystallized Latent Reasoning),一种针对多模态大语言模型(MLLMs)的单阶段隐空间思维链(Latent CoT)训练框架。该方法通过双路径一致性学习,使视觉隐向量在不依赖外部模型或额外标注的情况下,自发涌现出关键的视觉语义能力。

TL;DR

在多模态理解(MLLM)领域,如何让模型像人类一样进行深度的“视觉思考”一直是难点。本文提出的 CrystaL(Crystallized Latent Reasoning)通过一种巧妙的双路径(完整 vs. 退化)一致性学习,让模型在回答问题时,必须学会从隐空间(Latent Space)的连续变量中提取关键视觉特征。该方法不依赖 SAM、DINO 等外部专家模型,在单阶段训练下实现了感知任务的 SOTA 提升。

背景定位:隐空间推理的“名与实”

目前的 MLLM 推理主要分为三大流派:

  1. Textual CoT:将推理过程显式写成文字。缺点是文本量大、存在量化损失,且容易产生幻觉。
  2. Tool-augmented CoT:调用外部专家模型(如分割、检测)。缺点是流程不可导且速度慢。
  3. Latent CoT:在 LLM 的隐藏状态中进行隐含推理。

然而,Latent CoT 长期面临监督弱的问题。模型往往倾向于直接跳过隐空间推理,仅凭原始视觉 Token 就能猜出答案。这就导致所谓的“隐空间推理”名存实亡。CrystaL 的动机正是要打破这种现象,让隐空间 Token 成为推理过程中不可或缺的“结晶体”。

核心机制:随机退化与双路径“知识偷渡”

CrystaL 的核心思想可以用“遮住眼睛也能答对”来形容。具体流程如下:

1. 随机图像退化 (SIC Module)

作者引入了 Stochastic Image Corruption (SIC),对输入图像进行高斯模糊、随机掩码或颜色失真。这种退化充当了信息瓶颈,强制模型无法直接从原始像素提取足够证据。

2. 双路径对齐框架

  • 完整路径 (Intact Path):正常处理高质量原图,作为“教师”。
  • 退化路径 (Corrupted Path):处理被模糊后的图像。
  • 关键逻辑 (Crystallization):模型会将完整路径中生成的隐变量(Latent Tokens)拷贝到退化路径对应的层。

模型架构图

通过这种设计,退化路径虽然“眼睛”模糊了,但由于“偷渡”了来自完整路径的隐空间信息,它仍然能够预测出正确结果。这种依赖性迫使隐空间 Token 必须承载最核心、最鲁棒的视觉语义。

3. 一致性损失函数

为了让这一过程更稳固,CrystaL 设计了两层对齐:

  • 分布对齐 ():强制两个路径输出的 Logits 接近。
  • 机制对齐 ():强制模型在推理答案时,对隐空间 Token 的关注模式(Attention Map)保持一致。

实验战绩:高效率与强感知

CrystaL 在 CVBenchHRBench 等感知密集型测试集上表现惊人。尤其是在高分辨率任务中,超越了 Qwen2.5-VL 等强劲基线。

实验结果对比

深度分析:

  • 消融实验显示,8 个 Latent Tokens 是语义多样性与计算效率的平衡点。采用多样化的预置 Token 比重复使用同一个 Token 效果更好。
  • 数据效率是其最大亮点:仅需 16k 样本 即可达到或超过其他方法使用 100k 样本的效果,这得益于其自监督训练范式的精准性。

深度洞察与总结

CrystaL 的成功在于它深刻理解了 MLLM 的“惰性”。如果模型能走捷径,它绝不会去学习复杂的推理逻辑。通过人为制造信息不对称(完整 vs. 退化),CrystaL 变相地为隐空间推理设置了“升学考试”,只有真正学会了视觉逻辑的 Token 才能通过。

局限性: 尽管 Gaussian Blur 效果最好,但对于极度依赖局部微小特征(如 OCR 识别)的任务,通用的退化策略可能仍有提升空间。

展望: 未来的研究可以探讨将此框架应用于视频流推理,通过时间维度的退化(丢帧)来诱导模型形成更强的时空感知隐状态。

发现相似论文

试试这些示例

  • 调查最近除隐空间(Latent Space)外,还有哪些通过修改输入增强或博弈机制提升 MLLM 推理真实性的研究?
  • 追溯“Latent Chain-of-Thought”在纯文本大模型(如 Coconut 或 Quiet-STaR)中的原始定义及其演进逻辑。
  • 探索 CrystaL 中提出的双路径注意力对齐机制,是否可以推广到视频大模型中的跨帧语义对齐任务?
目录
[CVPR 2026] CrystaL:无需外部模态,MLLM 隐空间内自发涌现的视觉“结晶”推理
1. TL;DR
2. 背景定位:隐空间推理的“名与实”
3. 核心机制:随机退化与双路径“知识偷渡”
3.1. 1. 随机图像退化 (SIC Module)
3.2. 2. 双路径对齐框架
3.3. 3. 一致性损失函数
4. 实验战绩:高效率与强感知
5. 深度洞察与总结