WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

长上下文语言模型能否在基准分数之外提升可靠性?

长上下文大语言模型在基准测试中表现亮眼,但在需要推理(而非仅检索)的现实任务中却表现不佳。这一结论来自10项研究的证据。

直接答案

长上下文语言模型在特定狭窄基准测试中能提升可靠性,但在需要基于长文本进行推理(而非仅检索事实)的现实任务中往往表现不佳。例如,GPT-4o在移除字面匹配词的测试中,准确率从99.3%骤降至69.7%[2];在15个模型参与的174标签分类任务中,整体表现均不理想[5]。这10项研究提供的证据存在矛盾:虽然部分采用检索增强生成(RAG)或智能体工具的系统在医学考试中超越了独立模型[1],但其他基准测试显示,即便是最先进的模型在多文档推理[6]和多语言任务[8]中仍显吃力。因此答案是肯定的,但仅适用于特定条件——基准测试分数与现实可靠性之间的鸿沟依然巨大。

8篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

长上下文模型为何在某些测试中表现出色,却在其他测试中失败?

核心问题在于,许多流行的基准测试(如“大海捞针”测试)衡量的是模型从无关文本中找出单一事实的能力——这种技能无法迁移到现实世界的推理中。2025年的一项研究引入了NoLiMa基准测试,该测试移除了问题与答案之间的字面匹配,迫使模型推断关联。在短上下文(低于1000个词元)中,模型表现良好;但当上下文达到32000个词元时,13个模型中有11个的性能降至其短上下文基准水平的50%以下。即便是GPT-4o,也从99.3%下降到了69.7%[2]。这表明,当任务需要更深层次的理解而非模式匹配时,长上下文的可靠性便会崩塌。

另一项研究LongICLBench测试了15个长上下文模型在极端标签分类任务上的表现,其中类别多达174种,输入长度可达5万个词元。模型在标签较少的简单任务上表现尚可,但在最困难的任务(包含174个标签的Discovery任务)中表现明显不佳。研究者还发现模型对输入中后出现的标签存在偏好,这表明模型并未真正处理整个上下文[5]。这意味着简单检索任务的基准测试分数可能具有误导性——它们无法反映模型处理复杂、信息密集场景的真实能力。

长上下文能力何时才能真正提升可靠性?

长上下文模型在与检索增强生成(RAG)或智能体工具结合使用时,能够提升可靠性,尤其在专业领域表现突出。例如,2026年的一项研究构建了一个智能体系统,整合了文档检索、重排序和证据锚定功能,用于医学问答。在美国医师资格考试(USMLE)第一步中,该系统准确率达到82.98%,超过了GPT-4的80.67%;在第二步中,其得分为86.24%,而GPT-4为81.67% [1]。这表明,增加长上下文记忆库和工具使用能力,可以提升独立大语言模型所无法达到的可靠性。

类似地,2025年一项关于医疗问答的研究采用了一种名为BriefContext的映射-归约策略,以应对“中间信息丢失”问题——即模型会忽略长输入中位于中间部分的信息。该方法在多个大语言模型骨干网络和数据集上提升了鲁棒性[7]。在基因组学领域,一款具有8192个token窗口的长上下文DNA模型(PlantCAD2)将大型基因组中的染色质可及性预测AUPRC值从0.587提升至0.711,直接证明了更长的上下文有助于捕获远端调控元件[4]。这些案例表明,长上下文模型可以更可靠,但前提是任务确实需要利用更多信息,且系统能够有效处理这些信息。

检索增强生成(RAG)能解决长上下文问题吗?

RAG 常被提出作为一种解决方案,但相关证据好坏参半。2024年一项名为Loong的基准测试评估了模型在多文档问答中的表现,其中每份文档都相关——忽略任何一份都会导致失败。RAG在该基准测试中表现不佳,这表明仅仅检索文本片段并不能让模型跨文档进行推理[6]。另一项2026年关于多语言长上下文推理的研究发现,虽然现成的RAG有一定帮助,但并未解决核心问题:在多语言环境下,模型实际有效使用的上下文长度不足其声称长度的30%[8]

然而,2025年一项关于小型语言模型(SLLMs)的研究表明,一种结合指令调优嵌入检索与问题重述(将复杂查询拆解为子问题)的轻量级框架,在无需任何微调的情况下,将长上下文问答性能相较于强基线提升了高达5% [3]。这表明RAG(检索增强生成)确实能发挥作用,但前提是其设计需精心支持逐步推理,而不仅仅是事实检索。结论是:RAG并非万能灵药——只有与迫使模型跨多个段落处理并整合信息的策略相结合时,才能发挥最佳效果。

关于这些来源

该回答基于8篇经同行评审的研究——发表于2024年至2026年间,其中8篇为2024年及之后发表,1篇发表于Q1–Q2期刊——这些研究是从10篇通过质量筛选的文献中选出的最具相关性的成果,而10篇文献又源自从超过5亿篇论文的数据库中检索到的57篇论文。

本文引用的文献

1

面向医疗问答任务的智能体记忆增强检索与证据锚定。

一个具备检索、重排序和记忆库功能的智能体系统,在USMLE Step 1(82.98% vs. 80.67%)和Step 2(86.24% vs. 81.67%)上均超越了GPT-4,表明工具增强的长上下文系统在医学问答任务中可以击败独立的LLM。

2

NoLiMa:超越字面匹配的长上下文评估

NoLiMa基准测试通过去除字面匹配,导致13个长上下文模型中有11个在32K token长度下的表现降至其短上下文基线的50%以下;GPT-4o从99.3%下降至69.7%,揭示了模型依赖表面匹配的问题。

3

超越长度限制的推理:利用小规模语言模型提升长上下文问答的准确性

一种轻量级框架结合了指令微调嵌入检索与问题重述技术,在无需额外训练的情况下,将小型大语言模型在LongBench上的长上下文问答性能提升了高达5%。

4

PlantCAD2:面向被子植物跨物种功能注释的长上下文DNA语言模型

PlantCAD2是一种长上下文DNA模型,其窗口长度为8,192个碱基对,将玉米染色质可及性预测的AUPRC从0.587提升至0.711,并在12项任务中的10项上超越了拥有70亿参数的模型。

5

长上下文大语言模型在长文本情境学习中表现不佳

在LongICLBench(包含多达174个标签和5万词元的极端标签分类任务)上,15个长上下文模型在简单任务中表现良好,但在最困难的任务上表现不佳,显示出对后续标签的偏好以及对长输入内容的推理能力不足。

6

不遗漏任何文档:基于扩展多文档问答的长上下文大语言模型基准测试

在Loong基准测试中,所有文档均与答案相关,结果显示现有长上下文大语言模型与检索增强生成(RAG)的表现均不理想,这表明需要更优的多文档推理能力。

7

利用长上下文增强检索语言模型进行医学问答。

一种映射-归约策略(BriefContext)通过缓解“中间丢失”问题,在不修改模型权重的情况下,提升了医疗问答中RAG的鲁棒性。

8

LLMs能否在扩展的多语言上下文中进行推理?迈向超越“大海捞针”式检索的长上下文评估

MLRBench(多语言长上下文推理基准)发现,大语言模型在非英语环境下实际有效利用的上下文长度不足其声称值的30%,而检索增强生成(RAG)仅能提供部分改善。