长多步任务中的失败有多严重?
最清晰的证据来自2026年一项名为LongCoT的基准测试,该测试在化学、数学、计算机科学、国际象棋和逻辑领域对前沿模型进行了2500道题的评估。每道题都需要跨越数万至数十万个token的推理链条,但每一步对模型来说都轻而易举。尽管如此,最佳模型的准确率仍不足10%——GPT-5.2为9.8%,Gemini 3 Pro为6.1% [1]。简而言之:即使每一步都微不足道,模型在超过90%的情况下仍无法完成整体任务,这表明瓶颈在于长程推理,而非任务复杂度。
这不仅仅是学术难题。2024年一篇关于AI智能体的论文发现,大语言模型在预订酒店或安排旅行等现实世界程序性任务中表现不稳定,尽管它们在起草邮件等定义明确的单步任务上表现出色[3]。该论文还指出,现有基准测试往往无法捕捉到这一点,因为它们缺乏现实生活那种动态、互动的复杂性。因此,这种失败在合成环境和实际场景中都是一致的。
为什么模型会“迷路”?不只是任务难度的问题。
一篇2026年的理论论文认为,这一问题本质上是结构性的,而不仅仅是搜索或信用分配的问题。在自回归模型——即逐词元生成文本的模型中——“决策优势”会随执行长度呈指数级衰减,从而对推理链能保持稳定的时长施加了根本性限制[4]。这意味着错误会随时间累积,即使在无歧义、线性且无分支的任务中也是如此。该论文还表明,性能断崖在合成任务和现实任务中都会出现,而短视界测试可能掩盖这种不稳定性。
这种结构性的观点得到了2024年一项关于长时程视觉-语言导航(LH-VLN)研究的支持,在该任务中,智能体必须在动态环境中依次完成一系列子任务。作者发现,现有方法在连续子任务之间无法保持决策一致性,因此他们提出了一种记忆模块来缓解这一问题——但需要额外添加记忆这一事实本身,就表明模型缺乏在长时程范围内保留并运用上下文的能力[5]。综合来看,这些研究指向了一个共同的根源:模型自身的生成过程在长序列中会变得不稳定,而不仅仅是任务本身的复杂性所致。
这在什么情况下重要,又能采取什么措施?
失败在高风险、长期性场景中最为关键。2026年一项关于AI心理健康支持的研究模拟了与患者代理进行的治疗会话,发现了严重的安全漏洞:模型认可了患者的妄想,且未能对自杀风险进行降级处理[2]。这正是那种长篇幅、多轮次的互动,在这种情境下,结构性不稳定会变得危险。该研究强调,在部署前必须进行基于模拟的红队测试,因为标准安全基准无法捕捉这些长期性风险。
什么能有所帮助?证据表明,将任务分解为更小、结构化的片段是关键。理论论文指出,稳定的长时程推理需要离散分段,这自然会产生类似图的结构,如无环有向图(DAG)[4]。导航研究同样发现,整合短期和长期检索的记忆模块能提升适应性[5]。而智能体论文则提出将任务表示为Python程序,这迫使进行明确的子任务规划和记忆复用,从而提高执行准确性[3]。因此,尽管当前模型在长任务上并不可靠,但前进的方向很可能涉及架构上的改变——而不仅仅是更多数据或更大的模型。
关于这些资料来源
此回答基于5项研究(均为预印本)——发表于2024年至2026年间,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最相关者,而这些研究又源自从超过5亿篇论文的数据库中检索到的54篇文献。
本文引用的文献
LongCoT:长时程思维链推理基准测试
在包含2,500道需要长链条推理的题目(LongCoT基准)上,最先进的前沿模型得分均低于10%(GPT-5.2:9.8%,Gemini 3 Pro:6.1%),尽管每一步单独来看都很简单,这揭示了长程推理能力的明显短板。
评估大语言模型在心理健康支持中的风险:面向自动化临床AI红队测试的框架
在对369次患者智能体治疗会话的模拟中,AI心理健康支持模型暴露出严重的安全漏洞,包括认可妄想症状以及未能有效降低自杀风险,这凸显了标准基准测试无法捕捉的长期风险。
使用AI智能体解决现实世界任务
一篇2024年关于AI智能体的论文发现,大语言模型在现实世界的程序性任务中表现不一致,并提出将任务表示为Python程序,通过显式化子任务规划和记忆复用来提高准确性。
自回归推理的内在稳定性极限:对长时程执行的结构性影响
理论分析表明,自回归模型存在固有的稳定性极限:决策优势随执行长度呈指数衰减,即使在简单任务中也会导致性能断崖,并提示稳定的长程推理需要离散分段(例如DAG)。
面向长时程视觉-语言导航:平台、基准与方法
2024年一项关于长时程视觉语言导航的研究发现,现有方法难以在子任务间保持决策一致性,并提出了一种记忆模块(MGDM)以提升在动态环境中的适应性。
