[arXiv 2026] One-Eval:告别繁琐配置,用自然语言开启自动化模型评估新范式

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

总结
问题
方法
结果
要点
摘要

本文推出了 One-Eval,一个自动化的智能体(Agentic)LLM 评估系统。该系统能够将模糊的自然语言请求转化为可执行、可追溯且可定制的评估工作流,集成了意图解析、基准测试自动匹配(BenchResolve)以及决策导向的多维报告生成。

TL;DR

在 LLM 的开发周期中,评估(Evaluation)往往是最耗时却又不可或缺的一环。One-Eval 是由北京大学等机构提出的全新 Agentic 评估系统,它允许用户通过一句话(如“我想测试模型的数学推理和常识能力”)自动完成 Benchmark 筛选、数据下载、Schema 适配、指标计算到最终诊断报告生成的全流程。

核心痛点:为什么“跑个分”这么难?

目前的 LLM 评估方案(如 lm-eval-harnessOpenCompass)虽然提供了标准化接口,但仍面临以下挑战:

  • 发现成本高:面对成千上万的 Benchmark,新手难以快速锁定最符合业务需求的测试集。
  • 配置爆炸:每个数据集的字段名(Schema)、格式、Split(训练/测试集划分)各不相同,手动映射极易出错。
  • 指标单调:传统的 Accuracy 无法告诉开发者模型“为什么错”,缺乏对失败模式(如指令遵循失败 vs 逻辑错误)的深度洞察。

One-Eval 的系统架构:智能体的闭环

One-Eval 将复杂的评估任务拆解为三个协同工作的智能体阶段,并在关键节点引入 Human-in-the-loop (HITL) 机制以确保安全可控。

One-Eval 总体架构图

1. NL2Bench:从口语到执行计划

该模块负责解析用户的评价意图。例如,当用户要求“关注基础知识覆盖面”时,NL2Bench 会通过 TF-IDF 或 Embedding 检索,从本地 77 个精选基准库及 HuggingFace Hub 中筛选出 MMLU、GSM8K 等最相关的库,形成结构化的 EvalPlan

2. BenchResolve:消除数据异构性

这是 One-Eval 最具工程价值的部分。BenchResolveAgent 会自动处理:

  • 自动下载:对接 HuggingFace,自动寻找 testvalidation 分片。
  • Schema 归一化:通过 LLM 推理,将 CSV/JSON 等异构字段自动映射到统一的输入输出接口(Input-Output Interface)。

3. 指标推荐与多维报告

One-Eval 不仅仅返回一个分数值。它的 ReportGenAgent 会生成:

  • 宏观视图:雷达图展示各项能力分布。
  • 诊断视图:分析模型失败的具体原因(如 Hallucination、格式错误)。
  • 微观案例:提供 Case Study 表格,方便开发者进行数据调试(Debugging)。

实验战绩:高成功率与极简交互

在针对 100 个涵盖数学、代码、安全等领域的真实请求测试中,One-Eval 表现惊人:

  • 99% 的请求成功生成了初始计划。
  • 84% 的请求无需任何人工干预即可走通全流程,直接输出报告。
  • 11.4 分钟:完成一次全自动评估的中位耗时,远低于手动配置所需的数小时。

实验结果对比

与主流框架的对比显示,One-Eval 在**基准规划(Rec. Bench)指标自动推荐(Rec. Metric)**方面填补了行业空白。

资深主编点评

One-Eval 的本质是将 “评估” 这一行为从单纯的工具运行,抽象为一种 “意图理解到决策支持” 的智能体任务。它的核心技术直觉在于:利用 LLM 强大的语义对齐能力来解决数据工程中的“长尾”配置难题。

局限性与展望: 虽然 One-Eval 在通用领域表现卓越,但对于需要高度垂直领域知识(如复杂医疗法律条文)的评估指标推荐,仍需更强的领域库支撑。未来,该框架若能进一步整合多模态评估(VLM)及长文本能力的动态压力测试,将成为工业界大模型落地的“标配利器”。


关键词:LLM Evaluation, AI Agents, NL2Bench, BenchResolve, 自动化工作流

发现相似论文

试试这些示例

  • 查找最近其他试图利用大模型智能体(Agent)自动化 LLM 评估流程或简化基准测试配置的论文。
  • 哪篇论文最早讨论了 LLM 评估中异构数据集 Schema 归一化(Normalizing Heterogeneous Data Adapters)的问题?
  • 有哪些研究将 One-Eval 这种端到端评估框架应用到了多模态模型(LMM)或长文本处理能力的专项评估中?
目录
[arXiv 2026] One-Eval:告别繁琐配置,用自然语言开启自动化模型评估新范式
1. TL;DR
2. 核心痛点:为什么“跑个分”这么难?
3. One-Eval 的系统架构:智能体的闭环
3.1. 1. NL2Bench:从口语到执行计划
3.2. 2. BenchResolve:消除数据异构性
3.3. 3. 指标推荐与多维报告
4. 实验战绩:高成功率与极简交互
5. 资深主编点评