[ACL 2025] F2LLM-v2:打破语言壁垒,打造全尺寸、多语言 SOTA 嵌入模型

F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World

总结
问题
方法
结果
要点
摘要

本文推出了 F2LLM-v2 系列泛用型多语言嵌入模型,包含从 80M 到 14B 的 8 种尺寸。该模型在 6000 万高质量开源数据上训练,支持超过 200 种语言,并在 11 项 MTEB 基准测试中取得 SOTA 成就,涵盖多语言、代码和医疗等领域。

TL;DR

在当前嵌入模型研究中,由于数据和算力的倾斜,非英语语言往往沦为“二等公民”。来自蚂蚁集团与上海交大的研究团队推出了 F2LLM-v2,这是一套覆盖 80M 到 14B 参数量的全开源嵌入模型家族。它不仅在 11 项 MTEB 基准上刷写了记录,更重要的是,它通过模型剪枝知识蒸馏,让仅 80M 的小模型也能在多语言任务中爆发巨大能量。

痛点深挖:为何我们需要 F2LLM-v2?

尽管嵌入技术已从 Transformer Encoder(如 BERT)演进至 LLM-based Decoder 时代(如 E5-Mistral, NV-Embed),但行业仍面临两大痛点:

  1. 语言不平等:大多数模型在英语上表现优异,但在波兰语、波斯语、越南语等中低资源语言上几乎“失聪”。
  2. 效率与黑盒化:顶尖模型往往体积巨大且闭源,开发者在资源受限(如移动端、边缘计算)或对隐私要求高的场景下无计可施。

核心架构与方法论

F2LLM-v2 的成功建立在“海量高质量数据”与“高效训练策略”的双重驱动之上。

1. 282 种语言的大规模语料库

作者从 157 个公开源精炼出 6000 万个样本,涵盖 282 种自然语言和 40 种编程语言。与同类开源模型单纯刷榜不同,F2LLM-v2 特意增加了如阿拉伯语、印尼语等在 MTEB 中缺乏基准但实际应用广泛的语言数据。

2. 两阶段训练逻辑

  • 第一阶段(基础语义):在 2700 万检索样本上训练,建立稳固的全局语义空间。
  • 第二阶段(指令微调):引入任务特定指令,通过对冲刷 1800 万样本,强化模型在分类、聚类、重排序等细分任务下的判别力。

3. 三位一体的轻量化技术(剪枝、蒸馏、MRL)

这是本文的核心技术见解:

  • Matryoshka Representation Learning (MRL):允许模型在同一套权重下输出不同维度的向量(从 8 维到全尺寸)。这意味着你可以在不重新训练的情况下,根据索引成本动态缩减向量长度。
  • 知识蒸馏:作者将大模型(如 1.7B)作为 Teacher,通过 MSE Loss 指导剪枝后的 Student(如 0.6B、330M)进行学习,弥补了参数减少带来的性能损失。

模型配置与架构参数

实验战绩:全线 SOTA

F2LLM-v2-14B 模型在多语言检索、代码检索、医疗等 11 项 MTEB 基准中取得了全球第一。

小模型的逆袭: 在 330M 和 0.6B 体量的横向对比中,F2LLM-v2 在韩语、波兰语、日语等多个语言特定榜单上显著优于 Qwen3-Embedding 和 EmbeddingGemma。 多语言 MTEB 结果对比

消融研究揭示了 MRL 的魔力: 如下图所示,模型性能随着嵌入维度的增加而快速增长,但在 128 维后趋于平缓。这意味着在许多 RAG 场景中,使用 128 维甚至 64 维向量就能保留大模型 90% 以上的性能,从而节省数倍的内存和磁盘开销。 MRL 维度与性能曲线

深度洞察与总结

F2LLM-v2 的价值不仅在于它刷了多少分,而在于它提供了一套完整的“轻量化、多语言 LLM 嵌入”工业化方案。

  • Inclusive(包容性):真正关注到了全球英语之外的数十亿用户。
  • Performant(高性能):通过精心设计的两阶段训练和负采样,确立了新的开源 SOTA 标杆。
  • Efficient(高效):通过蒸馏和 MRL,让嵌入模型从“云端昂贵服务”变成了“人人可用的本地工具”。

总结 (Takeaway):F2LLM-v2 的全开源(包括训练数据、代码、中间权重)是嵌入模型领域的一次重要回归,它打破了闭源模型的垄断,也为端侧 RAG、代码检索等垂直领域的研究提供了极具竞争力的底座。


注:所有 F2LLM-v2 模型已在 Hugging Face 与 GitHub (CodeFuse-AI) 同步上线。

发现相似论文

试试这些示例

  • 查找最近其他利用马特罗什卡表示学习 (MRL) 来优化向量检索存储效率的论文。
  • 哪篇论文最早提出了将大语言模型 (LLM) 转换为嵌入模型的两阶段训练框架,F2LLM-v2 对其进行了哪些关键改进?
  • 目前有哪些针对低资源语言 (Low-resource languages) 的多语言嵌入模型评估基准,除了 MTEB 之外还有哪些?
目录
[ACL 2025] F2LLM-v2:打破语言壁垒,打造全尺寸、多语言 SOTA 嵌入模型
1. TL;DR
2. 痛点深挖:为何我们需要 F2LLM-v2?
3. 核心架构与方法论
3.1. 1. 282 种语言的大规模语料库
3.2. 2. 两阶段训练逻辑
3.3. 3. 三位一体的轻量化技术(剪枝、蒸馏、MRL)
4. 实验战绩:全线 SOTA
5. 深度洞察与总结