为何长时程任务会击穿简单评估
长程任务——比如引导机器人完成多步骤指令,或对长达一周的第一人称视频进行推理——要求模型能够保持上下文、提前规划,并执行一系列动作。这与针对单张图片回答单个问题有着本质区别,也使得评估变得更加困难,因为你不仅要衡量最终答案,还要衡量中间步骤的质量。例如,在机器人领域,一个在多样化数据(包括人类示范)上训练的模型,相比零样本基线,将人工干预的需求降低了46%,但即便如此,距离实际部署仍有很大差距,这表明长程任务的成功不仅仅在于识别物体[1]。
挑战的难度还在于需要随时间追踪依赖关系。在自我中心视频推理中,模型必须连接相隔数小时甚至数天的事件——这要求具备时间抽象和记忆能力。2026年提出的一个名为Ego-R1的框架采用了工具链思维方法,将长视频分解为可管理的子问题,在一项为期一周的基准测试中达到了46%的准确率,超过了Gemini-1.5-Pro(38.3%),但仍低于一个更强的闭源模型(53.7%)[3]。这表明,即使使用复杂的工具,长时程推理仍然是一个难题,而评估必须捕捉完整的推理轨迹,而不仅仅是最终答案。
工具使用与组合问题
长周期任务通常需要按顺序使用多种工具——比如先调用视觉模型检测物体,再通过检索系统查找相关信息,最后用语言模型进行综合。评估这类任务颇具挑战性,因为你需要检查模型是否选择了正确的工具、顺序是否恰当,以及在出错时能否灵活调整。2026年发布的基准测试VTC-Bench对19个领先的多模态模型进行了测试,任务要求组合多达32种不同的视觉操作。表现最好的模型Gemini-3.0-Pro也仅达到51%的准确率,而各模型在应对未见过的工具组合时普遍难以泛化,往往退回到少数熟悉的函数上[4]。这表明,长周期评估不能只看最终准确率,还需考察规划效率和工具选择能力——而这两点既难以自动化评估,也更难在不同模型之间进行横向比较。
同样的问题也出现在视频理解中,模型必须决定何时放大某一帧、何时检索过去的片段、以及何时进行总结。Kangaroo,一个视频语言模型,通过训练时逐步增加输入帧数来应对长视频,并在长视频基准测试中超越了更大的模型[2]。但它需要专门的学习课程来处理长输入这一事实,恰恰凸显了标准评估——通常使用短视频片段——既无法让模型为长时程任务做好准备,也无法真正测试其能力。因此,评估变成了一个移动的目标:你不仅是在问“这段视频里有什么?”,更是在问“模型能否弄清楚该看什么、何时看、以及为什么看?”
数据和基准的局限性使评估更加困难
长时程评估还受到高质量、多样化数据缺乏的制约。以机器人领域为例,2024年的一项研究收集了829,502个视频-文本对来训练模型,用于长时程视觉问答,但即便数据规模如此之大,模型在完成任务时仍需要人工监督[1]。这表明,现有的基准测试可能无法全面反映真实世界中长时程任务的复杂性,因此很难判断模型是真正在进步,还是仅仅对特定场景过拟合。
同样地,在图表理解方面,一项2025年的研究发现,模型缺乏解读图表等特定领域数据的能力,这主要归因于相关指令微调数据的不足[5]。他们利用GPT-4创建了一个数据集,用于生成多样化的图表任务,其模型(ChartLlama)在多个基准测试上优于以往方法。但这凸显了一个更广泛的问题:如果用于训练和评估的数据范围狭窄,那么长期表现——这需要在多种情境下具备泛化能力——就变得更加难以评估。同样的观点也适用于生物多样性预测,一项2026年的展望性研究指出,当前的物种分布模型是作为静态快照进行训练和评估的,忽略了扩散和历史遗留等长期动态因素[6]。这意味着,即使一个模型在短期基准测试中表现良好,它也可能在需要理解跨越数百年变化的长期任务上失败——而这一点是当前评估方法无法捕捉的。
关于这些资料来源
本回答基于6项同行评审研究——发表于2024年至2026年,其中6项为2024年或之后发表,1项发表于Q1期刊,合计被引144次——这些研究是从6项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的62篇文献。
本文引用的文献
RoboVQA:面向机器人的多模态长时程推理
RoboVQA收集了829,502个视频-文本对,并表明与零样本基线相比,视频条件模型将人工干预减少了46%,但在长时程任务中仍需要监督。
Kangaroo:一款支持长上下文视频输入的高性能视频-语言模型
Kangaroo,一个拥有80亿参数的视频语言模型,采用课程式训练流程来处理长视频,并在长视频基准测试中超越了规模更大的模型。
Ego-R1:面向超长第一人称视频推理的智能工具链思维
Ego-R1是一款拥有30亿参数的智能体,在为期一周的自我中心视频基准测试中取得了46%的准确率,超越了Gemini-1.5-Pro(38.3%),但仍落后于Gemini-3.1-Pro(53.7%)。
VTC-Bench:通过组合式视觉工具链评估智能多模态模型
VTC-Bench包含680个问题和32种视觉工具,研究发现,表现最佳的模型(Gemini-3.0-Pro)准确率也仅为51%,各模型在工具组合以及对未见操作的泛化方面均存在明显困难。
用于图表理解与生成的多模态大语言模型
ChartLlama在GPT-4生成的数据集上训练,在图表理解基准测试中超越了以往的方法,但该研究指出,缺乏领域特定数据是一个关键限制。
面向长周期物种分布预测的基于古生态学基础的生物多样性基础模型
一篇观点文章指出,物种分布模型是作为静态快照进行训练的,并提出了一种基于古气候数据的基座模型,以应对长期预测问题,但同时指出,当前的评估方法无法捕捉长期动态变化。
