[$1M-Bench] 语言 Agent 离人类专家还有多远?首个价值百万美元的专业能力大考
\$OneMillion-Bench: How Far are Language Agents from Human Experts?
本文推出了 1M-Bench),这是一个由行业专家策划、包含 400 个高难度任务的多领域 Agent 评测基准。该基准覆盖金融、法律、医疗等五大高经济价值领域,首次通过“专家工时价值”将模型能力转化为量化的经济经济效益。
TL;DR
随着大语言模型(LM)从简单的聊天助手演变为具备长程推理能力的 Agent,我们需要更严苛的标尺。本文介绍的 $OneMillion-Bench 放弃了传统的刷题模式,通过 400 个来自金融、法律、医疗等领域的真实专家任务,直接衡量 Agent 到底能帮人类省下多少钱。
核心结论: 顶级模型如 Claude-Opus-4.6 已经能创造显著经济价值,但大多数 Agent 在专业约束和复杂推理面前,依然会被 Web Search 带来的“噪声”带偏。
痛点深挖:为何分数不代表生产力?
目前的 Leaderboard 已经严重“饱和”,在 MMLU 或测验类基准上拿高分,并不意味着模型能像一个精算师那样审计 IFRS 17 准备金,或者像并购律师那样核查跨境合规条款。
传统基准的局限性在于:
- 静态性:容易受到数据污染,无法模拟真实世界的工作流。
- 缺乏价值感知:模型答对一道微积分和解决一个价值数万美元的商业咨询,在指标上没有区别。
- 忽视过程约束:专业领域往往不仅看答案,更看过程是否符合行业规范(例如:医生不能提供未经证实的疗法)。
评测方法论:由“钱”定义的金标
作者通过 2000 多个专家工时,将 400 个任务映射到真实市场的时薪和工作时间。
- 评估公式:。总价值超过 100 万美元。
- Rubrics 评分机制:不再只有对错,而是通过专家手写的细则进行打分。
- 负分惩罚(Negative Penalty):这是本文的一大亮点。如果 Agent 出现事实幻觉、违反行业规范或指令遵循失败,会面临 -20 到 10 的非对称扣分。这真实模拟了“专业领域不容犯错”的残酷性。
图 1:$OneMillion-Bench 的数据构建流程,包含专家设计、同行评审以及针对 SOTA 模型的对抗验证。
实验洞察:谁是真正的“职场精英”?
通过对 35 个领先模型的深蹲测试,我们得出了几个极具启发的结论:
1. Web Search 是“双刃剑”
对于强模型(如 Claude-Opus-4.6, GPT-5.4-High),搜索是能力的放大器。但对于许多中层模型,引入搜索反而导致分数下降。原因在于: Web 搜索引入了过时、非权威或冲突的信息,Agent 如果缺乏分辨“信噪比”的能力,反而会破坏自身的推理连贯性。
2. 专业领域的“天花板”依然很高
在金融领域,Agent 需要进行精确的财报提取和多步推导,这是目前的重灾区。模型常常在计算营业额天数、现金转换周期等细节上出现“算术崩塌”。
3. 指令遵循(Instruction Following)最为脆弱
实验显示,指令遵循是所有能力中最容易波动的一项。当 Agent 忙于调用工具和整合长文本时,往往会忘记最初设定的格式要求或特定禁令。
图 2:主流模型的经济价值榜单。我们可以看到搜索 Agent 相比 Vanilla 模型在帕累托前沿上的显著优势。
深度思考:未来的 Agent 应该怎么做?
通过分析失败案例(Failure Patterns),作者为未来的 Agent 开发指明了道路:
- 从“QA”转向“工作流”:不要只给一个结果,要学会像人类专家一样提供可追溯的证据链。
- 抗干扰推理:Agent 需要具备强大的“信息过滤”能力,在搜索结果中识别并排除非权威来源。
- 严格的职业合规:开发针对特定行业的“护栏”模型(Guardrails),防止模型在专业建议中踩坑。
总结
$OneMillion-Bench 不仅仅是一个新的基准,它是一次观念的重塑——评测 Agent 的最终目的不是看它有多聪明,而是看它在复杂的社会生产力环节中,能多大程度上替代昂贵的专业劳动力并保证可靠。
随着 GPT-5 类模型的持续进化,我们期待能看到这个“百万美元”缺口被填平的那一天。
