[arXiv 2024] ITO:打破模态隔阂,将图像与文本炼为一体
ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion
本文提出了 ITO (Image-Text as One) 框架,旨在解决视觉表征学习中图像与文本嵌入空间仍存在模态隔离的问题。通过结合“多模态多重对齐”与“训练时多模态融合”机制,在保持标准双编码器(Dual-encoder)推理效率的同时,实现了 SOTA 级别的跨模态对齐与集成。
TL;DR
长期以来,图像-文本对比预训练(如 CLIP)被认为是视觉表征学习的“黄金法则”。然而,即便 Loss 降得再低,图像和文本在特征空间中依然像“油和水”一样互不相容。本文提出的 ITO (Image-Text as One) 框架,通过在训练时引入一个“临时”的融合模块,成功消除了模态间隙。在推理时不增加任何计算开销的前提下,ITO 在分类、检索及多模态大模型(MLLM)任务上刷新了多项纪录。
痛点深挖:对齐并非真正的集成
在标准的双编码器架构中,图像编码器和文本编码器是“各自为政”的。对比学习(Contrastive Learning)虽然把成对的样本拉近了,但从全局视角看,图像特征依然聚在一簇,文本特征聚在另一簇。
- Modality Gap:这种空间上的隔离意味着模型可能在利用模态特有的“捷径”进行匹配,而非理解深层的语义。
- 训练不稳:像 SLIP 这样激进的方法,虽然引入了自监督信号,但在训练后期极易出现性能“掉头向下”的过拟合现象。
核心方法:ITO 的双剑合璧
ITO 的核心直觉在于:利用融合(Fusion)作为正则项,指导对齐(Alignment)的结构。
1. 多模态多重对齐 (Multimodal Multiple Alignment)
ITO 不再局限于“一张图配一句话”。它对图像进行多种 Augmentations,甚至对文本进行子句采样,在 Batch 内构建出 1-to-Many 或 Many-to-Many 的监督信号。这极大地增加了模型每一步学习的信息量。
2. 训练时融合 (Training-Time Fusion) —— 秘密武器
这是 ITO 最精妙的设计。作者在训练期间放置了一个轻量级的 2 层 Transformer 融合模块:
- 过程:将图像 Token 和文本 Token 扔进这个模块进行深层交互,并计算融合后的对比 Loss。
- 作用:这个模块像一个教练,强制要求原始的两个编码器输出能够“被无缝融合”的特征。
- 推理:一旦训练结束,教练下场。推理时只需保留原始的双编码器。

实验战绩:全线飘红
在 DataComp-1B 这种超大规模数据集上,ITO 分现出了极强的扩展性(Scaling):
- Zero-shot 分类:在 ImageNet 等 26 个数据集上,ITO 相比 CLIP 稳步提升。
- 线性探测 (Linear Probing):验证了其特征的判别力,ITO 在 ImageNet-1K 上比 CLIP 高出约 2.4%。
- MLLM 适配:将 ITO 的视觉编码器接入 LLaVA-1.5,其推理能力(如 VQAv2, MMVet)显著强于使用原生 CLIP 的版本。
上图展示了训练动态:CLIP 和 SLIP 在后期都有明显的性能下滑,而启用 Fusion (λ=2) 的 ITO 曲线异常平稳。
深度洞察:为什么 Fusion 这么重要?
通过 UMAP 可视化可以清晰看到,ITO 的嵌入空间中蓝色(图像)和红色(文本)交织得非常紧密。
- 消除模态歧视:Fusion 模块迫使编码器放弃那些“模态特定”的噪声,转而学习通用的底层语义。
- 注意力更聚焦:层级注意力可视化显示,ITO 在深层能更精准地锁死图像中的主体物体,而 CLIP 往往会被背景干扰。
总结与局限
ITO 证明了:不需要改变推理架构,仅靠重塑训练目标,就能获得质变。 它解决了对比学习中长期存在的模态隔离问题,并提供了更稳定的训练范式。
局限性:尽管推理效率没变,但训练时的内存和时间开销增加了约 1.15x - 1.4x。在极大规模训练时,这仍是一个需要权衡的成本。
展望:这种“训练时融合、推理时分离”的思想,可能会成为未来多模态表征学习的标准配置。
