WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

哪些证据缺口阻碍了长上下文语言模型的发展?

长上下文大语言模型在记忆瓶颈、评估基准以及长输入推理方面存在证据缺口,且在大规模应用时会出现关键性能下降。

直接答案

长上下文语言模型面临三大证据缺口:限制实际上下文长度的记忆瓶颈、缺乏能真正测试长上下文推理能力的现实基准,以及在需要综合大量信息进行推理的任务中表现不佳。例如,即便是Gemini这类最先进的模型,在处理5万词元的174标签分类任务时仍显吃力,暴露出处理长而富含上下文的序列时的明显短板[7]。与此同时,像PQCache这样的硬件方案虽能将推理效率提升4.6%,但仍面临延迟挑战[2];而检索增强方法如BriefContext虽有所助益,却未能彻底解决“中间信息丢失”问题[1]。综合来看,本研究中规模最大且引用最多的文献[9]指出,模型需扩大数个数量级才能处理长尾知识,而其他研究[7][8]则揭示现有基准无法充分衡量长上下文能力。

10篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

长上下文模型为何不能直接使用更多内存?

长上下文大语言模型在实际应用中的最大障碍在于,键值缓存(即注意力机制所需的中间数据)会随上下文长度线性增长,迅速耗尽GPU内存。例如,PQCache通过乘积量化压缩键值缓存,在InfiniteBench上相比现有方法实现了4.6%的分数提升,但仍需精细管理以避免延迟峰值[2]。硬件方案如BlockPIM和LoL-PIM则将计算迁移至内存(存内计算),以突破带宽限制——BlockPIM相比此前存内计算方案吞吐量提升62%[3],LoL-PIM相较GPU存内计算系统实现高达16倍加速[4]。然而,这些硬件方案尚未广泛部署,即便是其中最优者(例如将注意力计算卸载至计算存储驱动器的InstAttention),在13B模型上相比基于SSD的基线方案吞吐量仅提升11.1倍,仍远未达到实时长上下文推理的要求[6]

这些证据共同指向一个明确的结论:内存带宽,而非计算能力,才是主要瓶颈。四篇聚焦硬件的论文[2][3][4][6]均指出KV缓存是限制因素,并各自提出了不同的应对方案(量化、存内计算、存储卸载)。但没有任何一种方案声称能彻底解决问题——它们都在模型质量、延迟和可扩展性之间进行权衡。例如,PQCache虽能保持模型质量,却增加了额外开销[2];而LoL-PIM则需要定制编译器及多节点部署环境[4]。这表明,在超长上下文(10万+词元)场景下,目前尚无单一方案能够投入实际生产。

当前的基准测试真的能衡量长上下文理解能力吗?

不——现有的基准测试常常将上下文长度与任务难度混为一谈,那些在合成任务上表现良好的模型,在真实的长上下文推理中却难以胜任。LongICLBench基准测试[7]对模型进行了极端标签分类的评估,涉及多达174个类别和5万词元的输入,结果发现即便是顶尖模型如Gemini也表现挣扎:它们倾向于关注序列中后出现的标签,且无法对多条信息进行综合推理。同样,Ada-LEval[8]引入了可适应长度、最高达12.8万词元的测试,并报告称无论是闭源还是开源模型,“都表现出局限性……尤其在超长上下文场景中”。这两项研究[7][8]是此处唯一直接评估长上下文推理的工作,且一致认为当前模型在这方面表现欠佳。

差距不仅体现在记忆上,更体现在推理能力上。例如,“中间迷失”问题——模型会忽略长输入中间部分的信息——在医学问答中已有记载[1],即便采用检索增强生成(RAG)技术,该问题依然存在。BriefContext[1]通过映射-归约策略缓解了这一问题,但并未彻底消除。与此同时,本文引用最多的文献[9](被引569次)表明,模型难以学习长尾知识——即训练数据中极少出现的事实——而检索增强虽能提供帮助,却无法完全弥合这一差距。这说明,即便记忆能力无限,模型在处理需要跨长上下文整合大量事实的任务时,仍会失败。

模型真的学到了长程上下文,还是只学到了局部模式?

一个微妙但关键的证据缺口在于,某些模型(尤其是使用重叠词元训练的模型,如DNABERT)可能根本学不到长程上下文——它们依赖的是局部词元特征。一项关于DNA语言模型的研究[10]发现,使用重叠k-mer训练的DNABERT“难以学习更大的序列上下文”,其嵌入表示“主要反映词元序列”。这意味着,对于需要长程依赖关系的任务(例如预测远离基因的调控元件),模型可能只是在记忆局部模式,而非理解全局结构。同一篇论文指出,在基因组生物学任务上仍能取得良好表现,但前提是“更大的序列上下文相关性较低”。

这一发现与长上下文DNA模型PlantCAD2[5]的结果相互印证。该模型采用8192碱基对的上下文窗口,通过利用长程上下文信息,将玉米可及染色质预测的AUPRC值从0.587提升至0.711,相对提升幅度达21%。DNABERT的失败与PlantCAD2的成功形成鲜明对比,表明模型架构与训练方式至关重要:PlantCAD2是基于65个基因组训练的长上下文模型,而DNABERT则采用重叠词元。现有证据虽不统一但具有启示意义:长上下文模型能够学习长程模式,但前提是模型需为此专门设计——许多现有模型(包括部分通用大语言模型)可能只是在学习局部捷径。

关于这些来源

该回答基于10篇经同行评审的研究——发表于2022年至2026年间,其中9篇来自2024年及以后,1篇发表于Q1期刊,累计被引用633次——这些研究是从13篇通过质量筛选的文献中选出的最具相关性的成果,而13篇文献又源自从超过5亿篇论文数据库中检索到的55篇论文。

本文引用的文献

1

在检索增强型语言模型中利用长上下文进行医学问答

提出BriefContext,一种用于缓解医疗问答中“中间迷失”问题的映射-归约策略,在不修改模型权重的情况下提升鲁棒性。

2

PQCache:基于乘积量化的长上下文大语言模型推理KVCache方法

提出PQCache方法,利用乘积量化压缩KV缓存,在InfiniteBench上相比现有方法实现4.6%的分数提升,同时保持低延迟。

3

BlockPIM:面向支持PIM的长上下文大语言模型推理的内存管理优化

提出BlockPIM,一种面向PIM架构的跨通道块内存布局方案,在长上下文大语言模型推理中,相较于先前的PIM方案实现了平均62%的吞吐量提升。

4

LoL-PIM:基于可扩展DRAM-PIM系统的长上下文大语言模型解码

提出LoL-PIM,一种支持流水线并行的多节点PIM架构,在长上下文大语言模型解码中,相比GPU-PIM系统可实现高达16倍的加速。

5

PlantCAD2:面向被子植物跨物种功能注释的长上下文DNA语言模型

介绍了PlantCAD2,一种具有8192碱基对上下文窗口的长上下文DNA语言模型,通过利用长程上下文信息,将玉米中可及染色质预测的AUPRC从0.587提升至0.711。

6

InstAttention:面向成本效益的长上下文大语言模型推理的存储内注意力卸载机制

提出InstAttention,将注意力计算卸载到计算存储驱动器上,与FlexGen等基于SSD的解决方案相比,在13B模型上吞吐量提升高达11.1倍。

7

长上下文大语言模型在长程上下文学习中表现不佳

本文介绍了LongICLBench,研究表明,像Gemini这样的长上下文大语言模型在极端标签分类任务(最多174个标签,50K词元)中表现不佳,存在对后置标签的偏好偏差,且多信息推理能力较弱。

8

Ada-LEval:基于长度可调基准的长上下文大语言模型评估

提出Ada-LEval,一个可适应长达128K token长度的基准测试,发现无论是闭源还是开源的大语言模型,在超长上下文场景中均表现出局限性。

9

大型语言模型难以学习长尾知识

研究表明,大语言模型回答事实性问题的能力与预训练数据中相关文档的数量高度相关,而检索增强技术则降低了这种依赖性(该论文被引569次,是本文引用量最高的文献)。

10

区分DNA语言模型中的单词身份与序列上下文。

证明使用重叠k-mer训练的DNABERT难以学习更大的序列上下文,主要依赖token身份,这限制了其在长程基因组任务中的应用。