针对多语言大语言模型的定向合成数据,未来两年将如何改变低资源语言支持?

定向合成数据能够在两年内显著提升低资源语言AI的性能,降低成本,并实现与文化对齐的模型。

直接答案

定向合成数据——即为填补低资源语言空白而生成的AI文本——能够在两年内显著提升多语言大模型的支持能力,且成本往往仅为传统数据采集的一小部分。例如,一项研究以不到100美元的成本构建了具有竞争力的乌尔都语模型[2],另一项研究则表明,少量合成数据即可让较小的模型在低资源语言上超越其生成所用的大模型本身[5]。综合本综述中的各项研究,一个一致的规律是:经过精心筛选的合成数据能够提升模型在推理、知识和安全任务上的表现,但质量控制与文化细微差异仍是关键挑战[1][3][7]

8篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

低资源语言问题有多严重,合成数据究竟能做什么?

低资源语言——即数字文本有限的那些语言——在人工智能支持方面远远落后于英语,因为模型根本没有见过足够多的高质量示例。这并非一个小众问题:有数十亿人使用这些语言,而这一差距影响着从搜索、翻译到教育的方方面面。合成数据——即由人工智能模型生成而非从人类来源收集的文本——提供了一种快速且低成本填补这一空白的方式。这里的证据表明,它不仅仅是权宜之计,更可以成为真正的均衡器。例如,2025年的一项研究利用合成数据集构建了一个高性能的乌尔都语-英语模型,其效果优于多个领先的多语言模型——而整个训练预算不到100美元[2]。与通常花费数百万美元进行数据收集和训练相比,这堪称成本的大幅削减。

这一机遇的规模在预训练阶段同样显而易见。2026年的一项研究为10种印度语言创建了一个包含5400亿词元的合成数据集,表明合成数据可以大规模生成[7]。另一项2026年的研究发现,即便是少量的合成数据,也能让较小的模型超越其大型生成模型本身,尤其是在低资源语言中表现尤为突出[5]。这表明合成数据不仅仅是填补空缺——它实际上能产出比原始数据源性能更优的模型,因为它可以针对特定任务和语言进行定制。

合成数据以哪些具体方式改进低资源语言模型?

一个关键机制是知识注入:在预训练阶段将高质量的英文数据翻译成低资源语言。2026年的一项研究提出了SynTrans,正是采用这一方法,并发现它显著提升了知识密集型任务的表现,尽管有时会损害流畅度[1]。同一项研究还表明,合成数据可用于过滤嘈杂的真实世界数据——以合成样本为指引,对人工撰写的文本进行排序和筛选,选出最优者——其效果可与人类专家筛选相媲美,甚至更胜一筹[1]。这意味着合成数据有助于清理那些常常困扰低资源语言的杂乱、低质量数据。

另一种机制是针对性弱点修正。一项2026年的研究开发了一个名为HOTFIXR的框架,该框架能够探测模型的多语言弱点,并生成专门用于修复这些弱点的数据。该框架将分布内性能平均提升了6.2%,并将分布外语言上的灾难性遗忘降低了7.1% [4]。这一点至关重要,因为它表明合成数据不仅能用于增加数据量,还能用于解决模型能力中的特定缺口。类似地,一项2025年针对韩语的研究发现,经过精心筛选的合成数据能够支撑长期预训练而不会导致模型崩溃,其性能可与开放权重的多语言基线模型相媲美 [3]。这直接反驳了合成数据可能随时间推移降低模型质量的担忧。

有哪些陷阱和挑战?

合成数据并非万能灵药——质量和文化细微差别至关重要。一项2026年针对印度语言的研究发现,英文内容的翻译往往缺乏文化相关性,而直接用目标语言原生生成有时效果更好[7]。这与早前的研究结果相呼应,即SynTrans提升了知识水平,却损害了流畅度[1]。因此,尽管合成数据可以注入知识,但它未必能自动生成自然、符合文化语境的文本。解决方案似乎在于精心筛选并与真实数据混合使用,正如乌尔都语模型所展示的那样,该模型采用改良的自我指导技术,融入了文化相关性和安全对齐[2]

另一个挑战是安全性与偏见问题。2025年一项关于多语言护栏的研究采用双玩家强化学习框架生成合成安全数据,在英语基准测试上比最先进模型提升了近10%,同时速度快了4.5倍[8]。这表明合成数据有助于弥补安全缺口,但也凸显出,若缺乏精心设计,合成数据可能延续甚至放大偏见。最后,合成数据的有效性可能取决于语言之间的类型学距离——2026年一项关于语法错误检测的研究发现,零样本迁移的表现会随源语言与目标语言的亲缘关系远近而变化[6]。因此,当源语言和目标语言在结构上具有一定相似性时,合成数据的效果最佳。

关于这些资料来源

本回答基于8项研究(3项经同行评审,5项为预印本),发表于2025年至2026年间,其中8项为2024年或之后的研究。这些研究从9项通过质量筛选的研究中选出,被认为最具相关性,而后者又源自从超过5亿篇论文的数据库中检索到的32篇文献。

本文引用的文献

1

合成数据如何从数据质量角度改进多语言语言模型的预训练?

我们提出了SynTrans(翻译英语数据)和SynRank(利用合成数据过滤含噪的真实数据);SynRank在过滤效果上达到或超越了人类专家,并提升了知识密集型任务的表现,且更高的过滤率甚至能在数据量更少的情况下进一步提高性能。

2

Alif:通过多语言合成数据蒸馏推进乌尔都语大语言模型

开发了Alif-1.0-8B-Instruct,这是一个乌尔都语-英语模型,基于合成数据集(Urdu-Instruct)并采用改进的自我指令技术训练而成,在不到100美元的训练预算内,在乌尔都语任务上超越了多个更大的多语言模型。

3

KORMo:面向所有人的韩国开放推理模型

我们从头训练了KORMo-10B,一个拥有108亿参数的韩英双语模型,其中68.74%的训练数据为合成韩语数据。该模型的性能可与开放权重的多语言基线模型相媲美,并证明了合成数据能够支撑长期预训练而不会导致模型崩溃。

4

LLM通过有针对性的多语言合成数据变得更聪明

提出了HOTFIXR,一个数据生成框架,用于探测学生模型的多语言弱点并生成针对性的合成数据,将分布内性能提升了6.2%,将分布外任务上的灾难性遗忘降低了3.7%,并将分布外语言上的灾难性遗忘降低了7.1%。

5

作为生成器优于分类器:利用大语言模型与合成数据实现低资源多语言分类

使用最先进的多语言大语言模型为11种语言和4项分类任务生成了合成数据集,发现即使是少量的合成数据也能让较小的模型超越生成数据的大型模型本身,尤其是在低资源语言中表现尤为显著。

6

类型学距离与零样本语法错误检测性能

研究了利用多语言大语言模型生成的合成错误语料进行零样本语法错误检测,发现性能(F1分数)随源语言与目标语言之间的类型学距离变化而变化。

7

BhashaKritika:大规模构建印度语言的合成预训练数据

构建了BhashaKritika,一个包含5400亿词元的合成预训练数据集,覆盖10种印度语言,采用了5种技术,并发现将生成过程锚定于文档、人物角色和主题,以及语言选择,会影响数据质量;同时引入了一条模块化的质量评估流水线。

8

DuoGuard:一种面向多语言大语言模型护栏的双智能体强化学习驱动框架

提出了DuoGuard框架,这是一个双智能体强化学习框架,其中生成器与护栏模型共同进化以生成合成安全数据,在英文基准测试上相比LlamaGuard3(8B)实现了近10%的提升,同时以0.5B模型实现了4.5倍的加速,并显著推进了多语言安全任务。