当推理测试假设模型已经掌握该语言时,会发生什么?
核心问题在于,许多低资源语言的推理测试无意中衡量的是记忆能力,而非真正的推理能力。LingOly基准测试正是为了避免这一问题而设计,它采用了没有先前训练数据的冷门及灭绝语言,结果发现模型在较难问题上表现不佳——最优模型准确率仅为38.7%,仅比无上下文基线提升了24.7%[1]。这意味着,即使是最优秀的模型,在无法依赖记忆模式时,也仅比随机猜测略好一点,这凸显了当先验知识的假设被移除后,推理能力变得多么脆弱。
基准测试还显示出明显的资源梯度:语言资源越丰富,得分越高[1]。这表明模型依赖高资源语言中的统计规律,而当这些规律缺失时,推理能力便会崩溃。因此,当你移除熟悉语言模式这根“拐杖”后,当前的LLM便难以执行人类解谜者能够完成的多步推理。
推理能力能否从高资源语言迁移到低资源语言?
是的,但前提是进行有意识的训练,将语言理解与推理能力分离开来。2025年的一项研究引入了“英语枢轴思维链”(English-Pivoted Chain-of-Thought,简称CoT)训练法,即对模型进行微调,使其先用英语生成推理步骤,再以目标低资源语言输出最终答案[2]。该方法在极低资源场景下,将数学推理能力较其他基线模型提升了最高达28.33%,表明利用模型内部对英语的倾向性,可以释放出原本处于休眠状态的推理能力。
同一项研究发现,通过混合语言思维链或两阶段训练,将语言理解与推理明确分离,能够增强跨语言推理能力[2]。这表明,瓶颈并非模型本身的推理能力,而是其将低资源语言输入映射到内部推理空间的能力。然而,这种迁移并非自动发生,它需要使用目标语言数据进行监督微调,而这类数据可能并不总是可得。
在低资源语言本身拥有更多数据是否有帮助?
是的,但问题不仅仅在于数据量——更在于是否拥有一个覆盖模型开发全阶段的完整数据生态系统。藏语基础数据集(TFD)是首个结构化的藏语数据集,涵盖预训练、指令微调、安全对齐、偏好优化和推理监督,总计超过110亿个词元[5]。在该数据集上训练Sun-Shine系列藏语大语言模型,在理解、安全、推理和生成基准测试中均较强大基线取得了显著提升[5]。这表明,当一种低资源语言获得与高资源语言同等全面的数据支持时,其推理性能可以得到大幅提升。
这一发现补充了以英语为枢纽的方法:虽然通过英语进行桥接有所帮助,但拥有母语数据进行推理(如TIBSTC-CoT思维链数据集)同样至关重要。这两种策略并非相互排斥,而是针对问题的不同方面。以英语为枢纽的方法在母语数据稀缺时发挥作用,而完整的数据生态系统则是理想的长期解决方案。
我们如何判断推理在低资源语言中是否真正起作用?
评估本身就是一个挑战。基于参考的标准指标在低资源语言上往往失效,因此研究人员转而采用“大语言模型作为裁判”的方法。一项2026年针对罗马尼亚语的研究发现,评估策略必须因指标而异:细粒度分解在忠实度上达到了96%的人类一致性,而比较排序在答案相关性上表现最佳,达到90% [4]。这表明,在低资源语言中衡量推理质量并没有放之四海而皆准的方法,即便是自动化裁判也需要仔细的适配。
此外,基于推理的安全防护机制可能比基于分类器的机制更为稳健。ConsistentGuard作为一种基于推理的多语言安全防护工具,仅使用六种语言中的1000个训练样本,便超越了用更多数据训练的大型模型[3]。这表明推理不仅能用于解决谜题或数学问题,还可用于提升安全性与对齐性。然而,该研究也指出,轻量级模型在低资源语言的复杂推理方面存在困难,因此这些优势并非在所有模型规模中普遍适用。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的49篇文献。
本文引用的文献
LINGOLY:一项面向低资源语言与灭绝语言中奥林匹克级别语言推理谜题的基准测试
LingOly基准测试覆盖了90多种低资源语言和灭绝语言,结果显示,即使是最顶尖的大语言模型,在难度较高的语言谜题上准确率也仅为38.7%,仅比无上下文基线高出24.7%,这表明真正的多步骤、跨领域推理仍然是一大挑战。
面向极度低资源与濒危语言的推理迁移:通过样本高效的语言理解实现语言间的桥梁
英语枢轴思维链训练(English-Pivoted CoT Training)通过微调大语言模型,使其以英语生成推理过程并以目标低资源语言输出结果,在极低资源场景下,数学推理能力相比基线最高提升了28.33%。此外,该研究发布了LC2024,这是首个爱尔兰语数学基准测试集。
通过推理与对齐,以极少量训练数据解锁低资源语言的大语言模型安全防护机制
ConsistentGuard是一种基于推理的多语言安全防护机制,仅用1,000个训练样本,在六种语言上的表现便超越了使用更多数据训练的大型模型,这表明推理能力能够提升低资源语言环境下的安全性与对齐效果。
面向低资源语言的LLM-as-a-Judge:将Ragas与比较排序适配于罗马尼亚语
在评估面向罗马尼亚语的RAG系统时,细粒度分解在忠实度评估上达到了96%的人类一致性(使用Gemini 2.5 Pro),而比较排序在答案相关性上达到了90%,这表明评估策略必须针对具体指标量身定制,且轻量级模型在低资源语言的复杂推理任务中表现吃力。
TFD:面向低资源语言处理与大规模建模的综合结构化藏语基础数据集
藏文基础数据集(TFD)包含超过110亿个词元,覆盖了大语言模型开发的所有阶段,包括推理监督,使得Sun-Shine藏文大语言模型在理解、安全、推理和生成基准测试上相较于强基线取得了显著提升。
