[CVPR 2026] CrystaL:无需外部模态,MLLM 隐空间内自发涌现的视觉“结晶”推理
CrystaL: Spontaneous Emergence of Visual Latents in MLLMs
本文提出了 CrystaL (Crystallized Latent Reasoning),一种针对多模态大语言模型(MLLMs)的单阶段隐空间思维链(Latent CoT)训练框架。该方法通过双路径一致性学习,使视觉隐向量在不依赖外部模型或额外标注的情况下,自发涌现出关键的视觉语义能力。
TL;DR
在多模态理解(MLLM)领域,如何让模型像人类一样进行深度的“视觉思考”一直是难点。本文提出的 CrystaL(Crystallized Latent Reasoning)通过一种巧妙的双路径(完整 vs. 退化)一致性学习,让模型在回答问题时,必须学会从隐空间(Latent Space)的连续变量中提取关键视觉特征。该方法不依赖 SAM、DINO 等外部专家模型,在单阶段训练下实现了感知任务的 SOTA 提升。
背景定位:隐空间推理的“名与实”
目前的 MLLM 推理主要分为三大流派:
- Textual CoT:将推理过程显式写成文字。缺点是文本量大、存在量化损失,且容易产生幻觉。
- Tool-augmented CoT:调用外部专家模型(如分割、检测)。缺点是流程不可导且速度慢。
- Latent CoT:在 LLM 的隐藏状态中进行隐含推理。
然而,Latent CoT 长期面临监督弱的问题。模型往往倾向于直接跳过隐空间推理,仅凭原始视觉 Token 就能猜出答案。这就导致所谓的“隐空间推理”名存实亡。CrystaL 的动机正是要打破这种现象,让隐空间 Token 成为推理过程中不可或缺的“结晶体”。
核心机制:随机退化与双路径“知识偷渡”
CrystaL 的核心思想可以用“遮住眼睛也能答对”来形容。具体流程如下:
1. 随机图像退化 (SIC Module)
作者引入了 Stochastic Image Corruption (SIC),对输入图像进行高斯模糊、随机掩码或颜色失真。这种退化充当了信息瓶颈,强制模型无法直接从原始像素提取足够证据。
2. 双路径对齐框架
- 完整路径 (Intact Path):正常处理高质量原图,作为“教师”。
- 退化路径 (Corrupted Path):处理被模糊后的图像。
- 关键逻辑 (Crystallization):模型会将完整路径中生成的隐变量(Latent Tokens)拷贝到退化路径对应的层。

通过这种设计,退化路径虽然“眼睛”模糊了,但由于“偷渡”了来自完整路径的隐空间信息,它仍然能够预测出正确结果。这种依赖性迫使隐空间 Token 必须承载最核心、最鲁棒的视觉语义。
3. 一致性损失函数
为了让这一过程更稳固,CrystaL 设计了两层对齐:
- 分布对齐 ():强制两个路径输出的 Logits 接近。
- 机制对齐 ():强制模型在推理答案时,对隐空间 Token 的关注模式(Attention Map)保持一致。
实验战绩:高效率与强感知
CrystaL 在 CVBench 和 HRBench 等感知密集型测试集上表现惊人。尤其是在高分辨率任务中,超越了 Qwen2.5-VL 等强劲基线。

深度分析:
- 消融实验显示,8 个 Latent Tokens 是语义多样性与计算效率的平衡点。采用多样化的预置 Token 比重复使用同一个 Token 效果更好。
- 数据效率是其最大亮点:仅需 16k 样本 即可达到或超过其他方法使用 100k 样本的效果,这得益于其自监督训练范式的精准性。
深度洞察与总结
CrystaL 的成功在于它深刻理解了 MLLM 的“惰性”。如果模型能走捷径,它绝不会去学习复杂的推理逻辑。通过人为制造信息不对称(完整 vs. 退化),CrystaL 变相地为隐空间推理设置了“升学考试”,只有真正学会了视觉逻辑的 Token 才能通过。
局限性: 尽管 Gaussian Blur 效果最好,但对于极度依赖局部微小特征(如 OCR 识别)的任务,通用的退化策略可能仍有提升空间。
展望: 未来的研究可以探讨将此框架应用于视频流推理,通过时间维度的退化(丢帧)来诱导模型形成更强的时空感知隐状态。
