[CVPR Style] ViCLIP-OT:突破越南语图文检索瓶颈,基于最优传输的对齐新范式
AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization
本文推出了 ViCLIP-OT,这是首个针对越南语图像-文本检索的大规模视觉-语言基础模型。该模型通过集成 CLIP 式对比学习与相似度图正则化最优传输(SIGROT)损失,在低资源语言设置下实现了 SOTA 的跨模态对齐性能。
TL;DR
在多模态领域,越南语长期处于“低资源”的尴尬境地。本文提出的 ViCLIP-OT 是第一个专门为越南语设计的图文检索基础模型。它的核心贡献在于引入了 SIGROT(Similarity-Graph Regularized Optimal Transport) 损失函数,通过最优传输理论解决传统对比学习忽略批次内全局结构关系的痛点,显著提升了在 UIT-OpenViIC 等基准上的表现。
背景定位:为何现有的 CLIP 不够用?
尽管 CLIP 在英语世界大放异彩,但在处理越南语等低资源语言时面临双重挑战:
- 样本孤立性:标准的对比学习(InfoNCE)将每个图文对视为独立的个体,忽略了批次中不同样本之间可能存在的潜在语义关联(例如,两张不同图片可能都在描述“穿着奥黛的女孩”)。
- 模态间隙 (Modality Gap):图像和文本在嵌入空间中往往倾向于形成互不交叠的簇,这对于精细化检索是致命的。
核心动机与 Insight
作者认为,单纯增加数据量不是低资源语言的唯一出路。通过在训练中施加 “分布级”的约束,可以强迫模型学习更紧凑的对齐。作者将目光投向了数学上的 最优传输(Optimal Transport),旨在寻找一种全局最优的传输成本,从而在批次级别实现图文分布的精准匹配。
架构解析:SIGROT 机制
ViCLIP-OT 采用了双塔架构:视觉端使用 DINOv3 预训练的 ViT,文本端使用针对越南语优化的 Sentence-BERT。其核心黑科技 SIGROT 分为两步:
- 相似度图构建:不同于常规对比学习只看正样本,SIGROT 会计算批次内所有文本、所有图像之间的“全连接”相似度图 。
- 最优传输正则化:利用 Sinkhorn 算法求解非平衡最优传输(Unbalanced OT)方案 ,将此方案作为软标签与相似度图进行 KL 散度约束。

这种设计的逻辑在于:如果不止正样本对要靠近,而且语义相似的负样本在传输路径上也应当具有相似的代价,那么最终生成的特征空间将具有极高的几何一致性。
实验战绩:突破性的提升
在越南语图文检索的“金标准” UIT-OpenViIC 上,ViCLIP-OT 展现了惊人的实力:
- 平均 Recall@K:相比原始 CLIP 提升了约 5.75%。
- Zero-shot 泛化:在 Crossmodal-3600 跨语言测试中,领先幅度扩大到 11.72%。这证明了最优传输带来的结构化对齐具有更强的鲁棒性。

消融研究:Modality Gap 的消失
通过 UMAP 可视化可以清晰看到,传统的 SigLIP 在空间中形成了两个截然分开的岛屿(模态间隙显著),而加入 SIGROT 后,图像(圆点)与文本(三角)交织在一起,实现了真正的深度融合。

深度洞察与总结
ViCLIP-OT 不仅仅是一个越南语模型,它提供了一个低资源多模态对齐的通用模板:
- 为什么有效? 因为最优传输是对抗训练不稳定性、缓解对比学习“短视”问题的天然良方。
- 未来的启示:这一套 SIGROT 流程理论上可以垂直迁移到泰语、印尼语乃至医疗、工业等垂类领域。
虽然模型在复杂背景干扰下的注意力机制仍有改进空间(如 GradCAM 所示部分案例失效),但作为越南语视觉-语言领域的 Foundation Model,ViCLIP-OT 无疑树立了新的 SOTA 标杆。
