[CVPR 2026] Omnivorous Vision Encoder:让 DINOv2 告别“偏食”,实现视觉模态大统一

A Mixed Diet Makes DINO An Omnivorous Vision Encoder

总结
问题
方法
结果
要点
摘要

本文提出了 Omnivorous Vision Encoder 框架,通过参数高效的教师-学生机制,将 DINOv2 等高性能单模态视觉模型转化为“杂食性”编码器。该方法实现了 RGB、深度图(Depth)和分割图(Segmentation)在共享特征空间内的对齐,在跨模态检索和 3D 相关任务上达到 SOTA。

TL;DR

尽管像 DINOv2 这样的模型在视觉任务中表现卓越,但它们本质上是“偏食”的:同一场景的 RGB 图、深度图和分割图在它们的眼里完全是不同的世界。Google DeepMind 提出的 Omnivorous Vision Encoder 仅通过微调少量参数,就将这些异构模态完美映射到了同一个特征空间。不仅检索效果提升了 10 倍,更实现了“在 RGB 上训练、在深度图上推理”的开挂级跨模态泛化能力。

1. 痛点:被忽视的“模态鸿沟”

人类视觉具有惊人的稳定性,无论光影如何变化,我们对物体结构的认知是统一的。然而,研究人员发现 DINOv2 这类 SOTA 模型在特征对齐上表现糟糕:

  • 实证发现:同一场景的 RGB 图像和对应的深度图,其特征向量的余弦相似度竟然和两张完全无关的随机图片差不多。
  • 后果:这种不一致性导致模型难以在资源匮乏的模态(如只有激光雷达深度信息的场景)下复用 RGB 上的知识边界。

特征错位示例 图 1: 原生 DINOv2 在处理不同模态同一场景时特征完全错位,而本文方法成功将其拉近。

2. 核心方法论:杂食性训练“菜谱”

为了让编码器变得“杂食”(Omnivorous),作者没有选择从头训练昂贵的大模型,而是采用了一种极具性价比的蒸馏+适配策略。

2.1 教师-学生蒸馏架构

  • 冻结骨干:保留 DINOv2 前 8 层的参数(作为 Teacher),仅训练后 4 层作为适配器(Adapter)。
  • 双重损失函数
    1. InfoNCE Loss:驱动不同模态的同一场景特征相互靠近,排斥不同场景的特征。
    2. Anchoring Loss (关键):强制学生网络的输出不要偏离原始 DINOv2 太多。这保证了模型在学习“对齐”的同时,不会丢掉原始模型强大的语义判别力。

模型架构图 图 2: 参数高效的教师-学生对齐架构。

2.2 数据层面的“降维打击”

为了防止网络通过简单的颜色统计信息偷懒(Shortcut),作者设计了:

  • 自然着色 (Natural Colorization):将 RGB 的色彩分布迁移到深度图中。这迫使模型必须关注“几何结构”而非“颜色直方图”来实现对齐。
  • 模态混合 (Modality Mixup):在 RGB、深度和分割图之间进行随机插值,构建了一个连续的模态频谱。

3. 实验战绩:全线碾压

3.1 跨模态检索:从“盲人摸象”到“一目了然”

在 ScanNet 这种复杂的 3D 室内场景中,给定一张深度图去寻找对应的 RGB 图:

  • DINOv2: R@1 仅为 4.6%(几乎在盲猜)。
  • Omnivorous: R@1 飞跃至 46.1%,Median Rank 从 401.8 降到了 2.0

检索性能对比

3.2 零样本跨模态遷移 (Zero-Shot Transfer)

这是全篇最令人兴奋的实验:在 RGB 上训练一个深度预测器,然后直接把输入换成分割图。

  • 传统模型:彻底崩溃,RMSE 高达 1.536。
  • Omnivorous:表现依然稳健,RMSE 维持在 0.532。这意味着模型真正学到了模态无关的核心语义。

4. 深度洞察:为什么有效?

传统的对比学习(如 CLIP)通常需要海量数据,而本文通过 Anchoring Loss 成功借力了预训练基础模型的“语义先验”。 通过 PCA 可视化可以看到(见原文 Figure 5),Omnivorous 提取的特征图在不同模态下展现出了惊人的结构一致性。这证明了模型不是在做简单的格式转换,而是在 Latent Space 层面重构了视觉的本质。

5. 总结与展望

Omnivorus Vision Encoder 证明了视觉大模型并不需要为每一个模态单独训练一个分支。通过精心设计的对齐策略,单模态模型可以迅速进化为全能型选手。

局限性:目前主要针对 RGB、深度和分割三种模态。未来如果能引入红外(IR)、热成像甚至雷达点云,视觉基础模型将真正拥有“全知视角”。

结论:这是 DINO 系列向 3D 空间与物理世界理解迈出的重要一步,对于具身智能(Embodied AI)等需要多传感器理解的领域具有里程碑意义。

发现相似论文

试试这些示例

  • 查找最近一年内其他试图让视觉 Foundation Model 实现多模态特征空间统一(尤其是集成深度与法线信息)的研究。
  • 深度探讨 DINOv2 与 ImageBind 在特征对齐机制上的本质区别,以及本文提出的锚定蒸馏法是否可以应用于其它主流编码器。
  • 有哪些最新的研究将这种模态无关(Modality-agnostic)的编码器应用于自动驾驶中的多传感器融合或具身智能的策略学习任务?
目录
[CVPR 2026] Omnivorous Vision Encoder:让 DINOv2 告别“偏食”,实现视觉模态大统一
1. TL;DR
2. 1. 痛点:被忽视的“模态鸿沟”
3. 2. 核心方法论:杂食性训练“菜谱”
3.1. 2.1 教师-学生蒸馏架构
3.2. 2.2 数据层面的“降维打击”
4. 3. 实验战绩:全线碾压
4.1. 3.1 跨模态检索:从“盲人摸象”到“一目了然”
4.2. 3.2 零样本跨模态遷移 (Zero-Shot Transfer)
5. 4. 深度洞察:为什么有效?
6. 5. 总结与展望