[arXiv 2026] One-Eval:告别繁琐配置,用自然语言开启自动化模型评估新范式
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
本文推出了 One-Eval,一个自动化的智能体(Agentic)LLM 评估系统。该系统能够将模糊的自然语言请求转化为可执行、可追溯且可定制的评估工作流,集成了意图解析、基准测试自动匹配(BenchResolve)以及决策导向的多维报告生成。
TL;DR
在 LLM 的开发周期中,评估(Evaluation)往往是最耗时却又不可或缺的一环。One-Eval 是由北京大学等机构提出的全新 Agentic 评估系统,它允许用户通过一句话(如“我想测试模型的数学推理和常识能力”)自动完成 Benchmark 筛选、数据下载、Schema 适配、指标计算到最终诊断报告生成的全流程。
核心痛点:为什么“跑个分”这么难?
目前的 LLM 评估方案(如 lm-eval-harness 或 OpenCompass)虽然提供了标准化接口,但仍面临以下挑战:
- 发现成本高:面对成千上万的 Benchmark,新手难以快速锁定最符合业务需求的测试集。
- 配置爆炸:每个数据集的字段名(Schema)、格式、Split(训练/测试集划分)各不相同,手动映射极易出错。
- 指标单调:传统的 Accuracy 无法告诉开发者模型“为什么错”,缺乏对失败模式(如指令遵循失败 vs 逻辑错误)的深度洞察。
One-Eval 的系统架构:智能体的闭环
One-Eval 将复杂的评估任务拆解为三个协同工作的智能体阶段,并在关键节点引入 Human-in-the-loop (HITL) 机制以确保安全可控。

1. NL2Bench:从口语到执行计划
该模块负责解析用户的评价意图。例如,当用户要求“关注基础知识覆盖面”时,NL2Bench 会通过 TF-IDF 或 Embedding 检索,从本地 77 个精选基准库及 HuggingFace Hub 中筛选出 MMLU、GSM8K 等最相关的库,形成结构化的 EvalPlan。
2. BenchResolve:消除数据异构性
这是 One-Eval 最具工程价值的部分。BenchResolveAgent 会自动处理:
- 自动下载:对接 HuggingFace,自动寻找
test或validation分片。 - Schema 归一化:通过 LLM 推理,将 CSV/JSON 等异构字段自动映射到统一的输入输出接口(Input-Output Interface)。
3. 指标推荐与多维报告
One-Eval 不仅仅返回一个分数值。它的 ReportGenAgent 会生成:
- 宏观视图:雷达图展示各项能力分布。
- 诊断视图:分析模型失败的具体原因(如 Hallucination、格式错误)。
- 微观案例:提供 Case Study 表格,方便开发者进行数据调试(Debugging)。
实验战绩:高成功率与极简交互
在针对 100 个涵盖数学、代码、安全等领域的真实请求测试中,One-Eval 表现惊人:
- 99% 的请求成功生成了初始计划。
- 84% 的请求无需任何人工干预即可走通全流程,直接输出报告。
- 11.4 分钟:完成一次全自动评估的中位耗时,远低于手动配置所需的数小时。

与主流框架的对比显示,One-Eval 在**基准规划(Rec. Bench)和指标自动推荐(Rec. Metric)**方面填补了行业空白。
资深主编点评
One-Eval 的本质是将 “评估” 这一行为从单纯的工具运行,抽象为一种 “意图理解到决策支持” 的智能体任务。它的核心技术直觉在于:利用 LLM 强大的语义对齐能力来解决数据工程中的“长尾”配置难题。
局限性与展望: 虽然 One-Eval 在通用领域表现卓越,但对于需要高度垂直领域知识(如复杂医疗法律条文)的评估指标推荐,仍需更强的领域库支撑。未来,该框架若能进一步整合多模态评估(VLM)及长文本能力的动态压力测试,将成为工业界大模型落地的“标配利器”。
关键词:LLM Evaluation, AI Agents, NL2Bench, BenchResolve, 自动化工作流
