长上下文模型已超越人类的领域
在范围明确、风险极高的专业领域中,长上下文模型能够达到甚至超越人类专家的水平。最有力的证据来自一项随机盲法研究:基于大语言模型的系统(AMIE)与21名初级保健医生在100个多轮临床场景中进行了对比[1]。该模型在诊疗推理方面不逊于医生,且在治疗精准度与临床指南一致性上表现更优。在另一项基于英美药物处方集构建的用药推理基准测试(RxQA)中,当模型与医生均能获取外部药物信息时,模型在较难问题上的表现优于医生[1]。这表明,凭借长上下文窗口来容纳患者病史与诊疗指南,大语言模型能够提供具有临床实用价值的推理能力。
类似地,在基因组学领域,一种名为megaDNA的长上下文模型在噬菌体基因组上进行了预训练,能够从头生成长达96,000个碱基对的序列,其中包含功能性蛋白质和调控元件[4]。在机器人学中,一种将长上下文大语言模型规划器与强化学习相结合的系统,在复杂的双臂护理任务中实现了81.86%的平均成功率,与使用人类示范训练的模型表现相当[3]。这些结果表明,当任务定义明确且上下文相关时,长上下文模型能够生成有用且基于实际依据的输出。
硬件和软件修复能否弥合这一差距?
研究人员正积极开发解决方案,以推动长上下文模型的实际应用。在硬件方面,一种名为LoL-PIM的新型架构利用存内计算(PIM)技术加速长上下文大语言模型的推理,相比多GPU系统可实现最高8.54倍的加速,较GPU-PIM系统则达到16.0倍[2]。该方案有效解决了导致长上下文推理缓慢且成本高昂的内存带宽瓶颈问题。不过,这仍是一个通过仿真评估的硬件原型,尚未成为实际部署的系统。
在软件层面,一个名为TracLLM的框架能够帮助追溯长文本中哪些部分对模型输出产生了影响,从而支持调试并增强可信度[5]。这对实际部署至关重要,因为它使开发者能够验证模型是否真正利用了所提供的上下文,而非凭空生成内容。另一种方法采用检索增强生成(RAG)技术,从长文本中选择性提取相关信息,如临床管理系统[1]和机器人规划器[3]所展示的那样。这些技术虽能缓解长依赖失效问题,但增加了系统复杂性,且并未解决根本性的推理能力局限。
关于这些来源
该回答基于7篇经同行评审的研究——发表于2024年至2026年间,其中7篇为2024年或之后发表,1篇发表于Q1期刊,累计被引用69次——这些研究是从7篇通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的43篇文献。
本文引用的文献
面向疾病管理的对话式人工智能。
在一项针对100个多次就诊临床场景的随机盲法研究中,基于大语言模型的系统(AMIE)在诊疗推理方面不劣于21名初级保健医生,并在治疗精准度和指南遵循度上优于他们;在药物基准测试(RxQA)中,该系统在较难问题上胜过了医生。
LoL-PIM:基于可扩展DRAM-PIM系统的长上下文大语言模型解码
LoL-PIM是一种多节点存内处理架构,在模拟中针对长上下文大语言模型推理,相比多GPU系统实现了最高8.54倍的加速,相比GPU-PIM系统实现了16.0倍的加速。
基于时间上下文的大语言模型规划器与Transformer强化学习的双臂长时程生活护理机器人技术。
结合长上下文大语言模型规划器与强化学习的系统(TCP-TRL),在双臂生活护理任务中实现了81.86%的平均成功率,与使用人类演示训练的模型表现相当。
用于解读和生成噬菌体基因组的长期上下文语言模型
基于噬菌体基因组预训练的长上下文基因组模型(megaDNA)能够从头生成长达96,000个碱基对的序列,其中包含功能性蛋白质和调控元件。
TracLLM:一种用于归因长上下文大语言模型的通用框架
TracLLM 是一个能够归因长上下文中哪些部分影响了大型语言模型输出的框架,从而支持调试与信任验证。
基于大语言模型的单细胞组学分析代理基准测试。
针对单细胞组学分析的AI智能体基准测试表明,长上下文处理仍是一个持续存在的挑战,同时代码生成与上下文感知检索也面临难题。
LooGLE:长上下文语言模型能否理解长上下文?
在LooGLE基准测试(文档长度超过24,000个词元)中,大多数大语言模型在长依赖任务上表现不佳,即使其上下文窗口足够大,也无法捕捉需要跨上下文远距离部分建立联系的信息。
