超越最终准确率,公平评估还应衡量什么?
公平的评估不能只看简单的成功率,因为循环模型是用计算量换取准确率。在受控对比中,循环模型在多步骤工具使用上有所提升,但在单次API调用上的增益较小且因模型而异[4]。因此,公平的测试应分别报告单轮与多轮任务的准确率,并衡量每次成功调用的计算成本。扩展律研究发现,将模块循环四次相当于一个5.8亿参数的非循环模型,但训练计算量却相当于10亿参数的模型[7]——这意味着在相同验证损失下,计算开销增加了72%。在评估时,你需要判断这额外的计算量是否足以换来值得的准确率提升。
另一个关键指标是内部可靠性:模型能否在发出工具调用之前,从其隐藏状态中预测出它将调用哪个工具?一项研究表明,从内部状态读取工具选择在基准测试上能达到61-82%的准确率,而基础生成仅能达到2-10%[1]。这意味着模型在内部往往“知道”正确的工具,却未能将其输出。公平的评估应衡量这一差距,因为它能指示错误是源于表征问题还是输出连接问题。同一项研究发现,当模型在两个工具之间犹豫不决时,失败频率高出21倍[1]——因此,衡量置信度或不确定性可能有助于标记出高风险调用。
最后,公平的评估应同时包含合成基准和真实API基准。工具调用研究使用了包含15个工具的合成基准和一个真实API的航空业基准,结果发现内部引导在合成基准上的成功率为83%至100%,而在真实基准上则为77%至94%[1]。这一差异表明,合成基准可能高估了可靠性。因此,公平的评估应报告两类基准的结果,并理想情况下包含一个如视觉工具调用基准中的有状态环境,该研究发现,即使是最优秀的模型,在多轮视觉任务上的成功率也不足50%[5]。
应如何考虑计算规模和模型规模?
公平的评估必须控制计算量和参数量,因为循环模型会复用权重,可能显得比实际更便宜。等深度缩放定律研究引入了一个“循环等效指数”,其值为0.46,这意味着将某个模块循环四次并不等同于四个独立模块——在验证损失方面,其效果大约只有后者的一半[7]。因此,在比较循环模型与非循环模型时,你不仅需要匹配参数量,还必须匹配训练计算量和推理时的FLOPs。LoopMoE论文正是这样做的,它匹配了总参数量、每token的FLOPs以及活跃子层比例,结果发现循环MoE在9个基准测试中的8个上优于普通MoE[8]。这种受控比较正是让结果可信的关键。
规模同样重要:工具调用研究发现,内部引导在4B以上经过指令微调的模型中效果良好(准确率83-100%),但在较小模型上可靠性较低[1]。视觉工具调用基准测试则发现了“规划到精度的交叉点”:较小模型在决定做什么上失败,而较大模型在感知所见内容上失败[5]。因此,公平的评估应报告多种模型规模下的结果,并理想情况下按失败类型(规划、感知或执行)分别统计。否则,你可能会得出模型不擅长工具调用的结论,而实际上它只是不擅长视觉,反之亦然。
计算效率还包括推理时的选择。循环工具调用研究发现,自适应推理——仅在需要时分配更多计算资源——相比固定循环深度,能实现更好的计算与性能权衡[4]。因此,公平的评估不仅应衡量准确率,还应考虑每个成功任务的计算成本,并明确是否允许采用自适应策略。DSPy框架表明,优化流水线相比标准少样本提示可将性能提升25-65%[3],这提示评估协议本身可能对结果产生显著影响。公平的评估应明确模型是否允许针对基准进行优化,还是属于零样本测试。
为何内部可靠性与干预成功率应纳入评估?
公平的评估不仅应衡量模型的输出内容,还应检验其内部状态是否可靠。原型内省研究发现,对隐藏状态的探针能够以AUROC 0.797的准确率预测数学问题的最终成败,这优于仅使用捷径的0.731 [2]。这意味着模型的内部状态承载着关于任务质量的信息,而这些信息并未完全反映在输出中。对于工具调用而言,这可能意味着衡量模型对工具选择的内部表征是否与实际调用一致。工具调用研究显示,基础模型在能够发出工具调用之前,其内部已经携带了正确的工具信息,在基准测试中的准确率达到61-82%,而生成阶段仅达到2-10% [1]。因此,公平的评估应将这种“内部与输出之间的差距”作为诊断指标予以报告。
然而,内部可靠性并不能保证干预措施能够改善结果。原型内省研究测试了多种干预手段(分支、引导、LoRA),发现没有一种能产生经过验证的能力提升[2]。这是一个关键警示:即使我们能读取模型的内部状态,也可能无法利用它来修正错误。因此,公平的评估应区分“可读”与“可用”的内部信号。工具调用研究还发现,多轮智能体循环对干预措施而言稳定性较差,增益或损失高达30个百分点,且方向不一致[1]。因此,公平的评估应在单轮和多轮场景下都测试干预措施,并报告变异性,而不仅仅是平均效果。
最后,公平的评估还应考虑过度依赖工具的风险。对齐研究发现,大语言模型常常过度使用工具,而他们的框架在保持性能的同时减少了不必要的工具调用[6]。这表明,公平的评估不仅应衡量成功率,还应衡量工具效率——即完成任务所需的调用次数。一个模型在两次调用即可完成的情况下却调用了十次,即使最终成功,其效率也较低。因此,像“每项成功任务的调用次数”或“不必要工具使用率”这样的指标应纳入评估范围。
关于这些来源
本回答基于8项研究(2项经同行评审,6项为预印本),发表于2023年至2026年间,其中7项为2024年或之后发表,合计被引用539次。这些研究是从9项通过质量筛选的研究中选出的最相关者,而这9项研究又源自从超过5亿篇论文的数据库中检索到的35篇论文。
本文引用的文献
工具调用在语言模型中具有线性可读性和可操控性。
工具选择在激活空间中编码于单一方向;通过方向引导,在合成基准上切换工具的准确率为83-100%,在真实API基准上为77-94%,但多轮循环的稳定性较差(得分波动可达±30点)。
循环语言模型中的操作性原型内省:过程质量探针、可执行分支与读出控制边界
对隐藏状态的探测能以AUROC 0.797(而仅凭捷径特征为0.731)预测在GSM8K上的最终成功,但没有任何冻结干预措施带来经验证的能力提升,因此我们将该读出称为“操作性原始内省”。
DSPy:将声明式语言模型调用编译为自我改进的流水线
DSPy是一种用于优化语言模型流水线的编程模型,在案例研究中,其性能相比标准少样本提示提升了25-65%,相比专家创建的演示样本提升了5-46%。
循环语言模型提升组合式工具调用能力
循环语言模型提升了组合性与依赖感知的工具使用能力,其准确率随循环深度增加而提高,但对于孤立的API调用,提升幅度较小且更依赖模型本身;自适应推理则在计算与性能之间提供了更优的权衡。
MM-ToolSandBox:一个用于评估视觉工具调用代理的统一框架
在包含500多个工具的视觉工具调用基准测试中,即使是最优秀的模型,成功率也不到50%;其中53%的失败源于从图像中错误提取信息,而较小的模型在规划环节出错,较大的模型则在感知环节失败。
大语言模型高效工具调用的对齐方法
一种多目标对齐框架通过估算知识边界,在保持性能的同时减少不必要的工具使用,从而解决了工具调用中的过度依赖和过度自信问题。
一次循环值多少钱?循环语言模型的等深度缩放定律
对循环次数1至8进行等深度缩放定律扫描,发现循环等效指数为0.46,这意味着将某个模块循环四次,其效果相当于一个5.8亿参数的非循环模型,但训练计算成本却相当于一个10亿参数的模型。
LoopMoE:将迭代计算与混合专家统一用于语言建模
LoopMoE,一种循环混合专家模型,在3B参数规模下,于9个下游基准测试中的8项上超越了标准MoE模型(平均提升超过1个百分点),且参数、FLOPs和活跃子层比例均保持一致;在9B规模下,这一优势依然持续。
