[CVPR 2026] Granulon:唤醒像素级视觉编码器,实现自适应多粒度 MLLM 推理
Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM
本文提出了 Granulon,一种基于 DINOv3 的多模态大语言模型(MLLM)。该方法通过引入自适应多粒度语义增强机制,克服了传统 CLIP 模型在细粒度感知上的不足,实现了从“像素到精细再到粗放”的统一视觉推理。
TL;DR
传统的多模态模型(MLLM)常陷入“看得到大轮廓却看不清细微处”(CLIP 派)或“看得清纹理却抓不住重点”(DINO 派)的矛盾中。Granulon 通过引入一个受文本启发引导的“粒度控制器”,让本来只擅长像素级观察的 DINOv3 模型学会了根据问题“变焦”——面对宏观问题进行语义抽象,面对微观问题保留像素细节。实验表明,这种方法让模型推理准确率提升了 30%,幻觉减少了 20%。
痛点深挖:视觉编码器的“近视”与“散光”
目前的 MLLM(如 LLaVA 等)大多依赖 CLIP 作为视觉支柱。CLIP 强在语义对齐(看一眼就知道是狗),但弱在空间细节(看不清狗耳朵上的毛色)。
为了补齐短板,研究者开始引入 DINOv3 这种像素级编码器。DINO 极度擅长局部几何和纹理,但在处理需要全局语义抽象的复杂指令时,它却表现得像是个“只盯着局部看的工匠”,缺乏对宏观语义的处理能力。
以往的解决办法是“叠罗汉”——同时挂载 CLIP 和 DINO 两个编码器。但这极大地增加了计算负担,且未能从根本上解决单一编码器内部缺乏多粒度调节能力的问题。
核心方法:Granulon 的“自适应变焦”机制
Granulon 的直觉是:视觉 Token 的粒度应该由用户问的问题来决定。
1. 文本条件粒度控制器 (Text-conditioned Controller)
模型首先利用 LLM 的浅层表示来解析问题的语义范围。如果问题是“这幅画描述了什么氛围?”,控制器会倾向于粗粒度;如果问题是“图中狗耳朵是什么颜色?”,则切换至细粒度。
2. 自适应 Token 聚合 (AdaTA)
这是实现“变焦”的关键步骤,分为三个阶段:
- 粒度引导池化 (Pooling):根据预测值动态调整特征图分辨率。
- 关系感知聚类 (Clustering):利用注意力和像素相似度,将相关的视觉信息聚类为语义原型。
- 特征精炼 (Refinement):通过质量评分剔除无用噪声,保留最核心的 Token。
图 1: Granulon 的整体架构,展示了从文本分析到 AdaTA 模块动态生成 Token 的全过程
实验与结果:彻底告别“一本正经胡说八道”
SOTA 对比
在 Qwen-2.5 和 Llama-3.2 两种底座上,Granulon 在 SEED-Bench(VQA 任务)和推理任务(FLUX-Reason)上均刷新了记录。相比于 CLIP 方案,在 A-OKVQA 上 Recall 提升幅度甚至达到了惊人的 35%。
显著降低幻觉
这是 Granulon 最引人注目的特质。通过对比 Case Study 发现,CLIP 经常产生“语义漂移”(例如把木屋描述成带不锈钢厨房的豪宅),而 Granulon 因为有 DINOv3 的像素级底子支撑,生成的描述极其详实且完全符合事实。
图 2: 不同视觉编码器下的幻觉率对比,Granulon 显著低于主流方案
深度洞察:为什么这种方法有效?
作者通过 Layer-wise Alignment Analysis(层间对齐分析) 揭示了一个深刻的本质: LLM 在推理过程中,随着层数加深,对视觉证据的需求会从小尺度细节过渡到大尺度语义。Granulon 提供的多粒度表征像是一个“多级支架”,在不同深度都能与 LLM 的表征建立极高的余弦相似度(达到 0.8 以上,而 CLIP 仅为 0.6)。
图 3: Granulon 与基行在模型层间的语义对齐一致性对比
总结与局限性
Granulon 标志着视觉编码器从“固定输出”向“任务感知”的转变。
- Takeaway: 增强像素级编码器的粗粒度抽象能力,比单纯堆叠语义编码器更有潜力。
- 局限性: 虽然该方法提升了推理精度,但在控制器判断失误时(如复杂的复合粒度任务),仍可能造成细微信息的丢失。未来的方向可能是实现更精细的并行多粒度注意力机制。
这项工作为构建更可靠、低幻觉的多模态地基模型指明了方向。
