Agents’ Last Exam:跨越从 AI 刷榜到经济产出的“最后一公里”

Agents' Last Exam

2026-01-01
Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song
总结
问题
方法
结果
要点
摘要

本文介绍了 Agents’ Last Exam (ALE),这是一个由 UC Berkeley 联合 250 多位行业专家开发的通用计算机使用智能体 (GCUA) 深度基准。它涵盖了基于 O*NET 活分类的 13 个行业领域和 55 个子领域,包含 1,000 多个真实且具备经济价值的长程任务。

TL;DR

尽管 AI 在数学竞赛、代码生成等基准测试上捷报频传,但在真实的各行各业办公场景中,AI 助力的经济效益提升依然有限。UC Berkeley 等机构推出的 Agents’ Last Exam (ALE) 试图打破这一僵局。它不仅是一个基准,更是 AI 智能体的“执业资格考试”。ALE 涵盖 55 个细分行业,通过 1,490 个真实、长程的专业任务,彻底撕掉了当前 AI 智能体在专业领域“仅能处理演示 Demo”的伪装。

痛点深挖:为什么 SOTA 刷榜在现实中失效了?

目前大多数 Agent 基准测试存在三个硬伤:

  1. 任务碎片化 (Task Atomicity):如“打开浏览器并搜索”,这只是个动作(Action),而不是职业工作流(Workflow)。
  2. 环境合成化 (Synthetic Bias):测试环境往往是为 Agent 量身定制的简化版,避开了专业软件(如 AutoCAD, SolidWorks, DaVinci)的复杂交互。
  3. 验证主观化 (Vague Evaluation):依赖 LLM-as-judge 容易导致过度宽容或评分漂移。

ALE 的核心直觉是:如果智能体不能像专家一样处理长达数天甚至数周、跨软件协同的职业项目,它就永远无法产生真正的 GDP 价值。

核心方法论:Generalist CUA 架构

作者提出,要通过 ALE 的测试,智能体必须进化为“通用计算机使用智能体 (GCUA)”。这种智能体拥有五个功能层:大脑 (LLM 决策)眼睛 (GUI 感知)身体 (流程控制)双手 (工具调用)双脚 (运行时环境)

模型架构图

在 ALE 中,一个典型的任务(如:注塑模流分析)要求模型首先在 Linux/Windows 虚拟机中分析复杂的 3D 步进,调整工艺参数,运行仿真软件,最后从海量的数值输出中整理出符合规范的 JSON 报告。这需要智能体在 GUI 的视觉反馈和 CLI 的代码操控之间实现无缝切换。

实验与结果:残酷的现实

ALE 的难度被分为三个等级:Near-Term (当前 SOTA 可尝试)、Full-Spectrum (覆盖所有领域)、Last-Exam (最难前沿)。

实验结果对比

即使是尚未公开的 GPT-5.5 配合最强的 Codex 代理框架,在整体通过率上也仅达到了 26.2%。最为核心的发现是:智能体虽然能熟练地点击鼠标,但它们常常不知道“为什么要点这里”。在失败案例分析中,由于领域知识缺失 (Domain Knowledge Gap) 导致的失败占比极高。

需替换为失败原因分析图

深度洞察:ALE 对未来的启示

  • 领域知识是核心壁垒:未来的 Agent 研究重点将从“如何提高动作准确率”转移到“如何让 LLM 理解复杂的垂直行业规范”。
  • 长程规划的鲁棒性:ALE 中的任务通常需要成百上千步的操作,任何一步的中间错误(如软件弹窗处理不当)都会导致多米诺骨牌式的失败。
  • 闭环验证的必要性:ALE 坚持使用确定的交付物检查(如 G-code 碰撞检测、财务数值容差匹配),这种严苛性将倒逼 Agent 开发更加注重结果的确定性。

总结

ALE 为智能体研究设定了一个极高的“天花板”。它不仅仅是一张榜单,更是一个指向标:只有当 AI 能够通过这些源自真实世界的、枯燥且复杂的“末日考试”时,我们才真正进入了 AI 改变生产力的时代。


作者注:ALE 是一个持续增长的动态基准,目前仅公开了 10% 的任务以防止数据污染,这是一项长期且艰巨的工程化评估工作。

发现相似论文

试试这些示例

  • 查找最近其他试图通过模拟真实办公环境或专业软件操作来评估 AI Agent 长程规划能力的基准测试论文。
  • 哪篇论文最早定义了计算机使用智能体 (Computer-Use Agent, CUA) 的分层架构,ALE 在其基础上做了哪些关于视觉与逻辑结合的改进?
  • 有哪些研究在探讨如何通过强化学习或长文本上下文优化来解决 ALE 论文中提到的领域知识缺失(Domain Knowledge Gap)问题?
目录
Agents’ Last Exam:跨越从 AI 刷榜到经济产出的“最后一公里”
1. TL;DR
2. 痛点深挖:为什么 SOTA 刷榜在现实中失效了?
3. 核心方法论:Generalist CUA 架构
4. 实验与结果:残酷的现实
5. 深度洞察:ALE 对未来的启示
6. 总结