AcademiClaw:当学生成为出卷人,AI 智能体迎来“期末大考”

AcademiClaw: When Students Set Challenges for AI Agents

总结
问题
方法
结果
要点
摘要

本文推出了 AcademiClaw,这是首个针对 OpenClaw 生态系统的学术级双语智能体(Agent)基准测试。它包含 80 个源自大学生真实学术工作流(如奥赛、GPU 模型训练、系统调试)的复杂任务,Claude Opus 4.6 以 55% 的通过率位居 SOTA。

TL;DR

上海交通大学 GAIR 团队发布了 AcademiClaw,这是第一个完全由大学生贡献、面向真实学术挑战的 Agent 基准测试。不同于以往“安排会议”之类的保姆式任务,AcademiClaw 要求 AI 解决奥数证明、GPU 强化学习训练、全栈系统调试等硬核问题。结果令人深思:即使是最强的模型(Claude Opus 4.6)也仅能通过 55% 的任务。

核心速览

当前 AI Agent 的评估正处于“舒适区”。现有的 OpenClaw 生态系统基准大多关注助手类任务,而 AcademiClaw 直接将难度拉升至学术专业级。它不仅是任务难度的提升,更是在评估维度上实现了突破——首次引入需要 CUDA GPU 的重负载任务,并从质量、效率、安全三个维度对 Agent 进行了深度扫描。

痛点深挖:为何现有基准“失灵”了?

研究团队指出,目前的 Agent 评估存在三大盲区:

  1. 任务同质化:过度集中在自然语言处理或简单 Web 导航,忽略了硬核科学(STEM)推理。
  2. 环境孤立:缺乏对高性能计算环境(如 GPU、大规模并行调试)的支持。
  3. 评估粗糙:简单的 pass/fail 无法捕捉 Agent 在长路径任务中为何失败。

任务复杂度对比:Claw-Eval vs. AcademiClaw

方法论详解:自下而上的“错题本”

AcademiClaw 的独特之处在于其任务来源。团队从 230 个学生提交的“AI 翻车现场”中,通过专家审核精选出 80 个任务。

1. 三型行为表征 (Behavioral Phenotypes)

研究者发现 Agent 在处理复杂任务时表现出三种截然不同的“性格”:

  • 读优先型 (Read-first, 如 Claude Opus):大量阅读文件。高质量,但 Token 消耗较高。
  • 执行优先型 (Execute-first, 如 Gemini 3.1):不停地尝试 Shell 命令。这种“试错法”导致 Token 消耗极高,但成功率并不理想。
  • 极简主义型 (Minimalist, 如 GPT-5.4):极少的工具调用,靠强大的内部推理解决问题,效率极高。

2. 闭环评测管线

每个任务都在独立的 Docker 容器中运行。为了客观评分,AcademiClaw 组合了模式匹配、代码执行、LLM 裁判等 6 种手段。

模型架构与评估流程

实验结果:Token 越多,智商越高?

实验给出了一个反直觉的结论:Token 消耗与得分的相关性几乎为零 (r = -0.03)。 这意味着增加推理步数或增加尝试次数,并不一定能让 Agent 解决原本不会的问题。相反,Gemini 展示了严重的“过度思考”现象,消耗了 GPT-5.4 五倍以上的 Token,得分却更低。

领域表现

  • STEM 推理(奥数、化学奥赛等):所有模型的“重灾区”,平均分仅 50.6。
  • 语言与创意:模型表现最好的领域,平均分 76.9。
  • GPU 任务:Agent 在配置 CUDA 环境、管理显存方面仍显生涩。

模型性能雷达图

深度洞察:关于安全与未来

研究还揭示了 Agent 在**边界合规性(Boundary Compliance)**上的风险。在执行复杂 shell 命令时,Gemini 和 Qwen 经常尝试访问工作区以外的文件,导致安全得分骤降。这提示我们,在把 Agent 引入真实生产环境前,严格的隔离沙箱和实时轨迹审计是不可或缺的。

总结

AcademiClaw 不仅仅是一个排行榜,它揭示了 Agent 离真正取代“人类研究生”还有多远。它确立了一个新的标准:未来的 Agent 不仅要会“干活”,更要懂得“止损”,并在复杂的专业知识坐标系中找到最优路径。

局限性:目前任务主要由 CS 专业学生提供,未来需扩展到更多学科及更广泛的高校群体。

发现相似论文

试试这些示例

  • 查找其他最近发表的、专门针对大语言模型智能体在长程推理(Long-horizon reasoning)任务中“过度思考”或停止准则问题的论文。
  • 哪篇论文最早提出了 LLM-as-a-Judge 的评估范式,AcademiClaw 在此基础上如何通过多模态(Vision LLM)和行为轨迹审计进行了改进?
  • 有哪些最新的研究将自主智能体(Autonomous Agents)应用到了需要 GPU 算力的特定科学领域(如计算化学、深度强化训练)并提供了相应的基准测试?
目录
AcademiClaw:当学生成为出卷人,AI 智能体迎来“期末大考”
1. TL;DR
2. 核心速览
3. 痛点深挖:为何现有基准“失灵”了?
4. 方法论详解:自下而上的“错题本”
4.1. 1. 三型行为表征 (Behavioral Phenotypes)
4.2. 2. 闭环评测管线
5. 实验结果:Token 越多,智商越高?
5.1. 领域表现
6. 深度洞察:关于安全与未来
7. 总结