Claw-Anything:打破孤岛,构建全知全能的数字化个人助手

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital World

2026-01-01
Yusong Lin, Xinyuan Liang, Haiyang Wang, Qipeng Gu, Siqi Cheng, Jiangui Chen, Shuzhe Wu, Feiyang Pan, Lue Fan, Sanyuan Zhao, Dandan Tu
总结
问题
方法
结果
要点
摘要

本文推出了 Claw-Anything,这是一个旨在评测“全天候个人助理”能力的深度基准测试。它通过整合长程活动历史、相互依赖的后端服务以及跨设备的 GUI 和 CLI 交互,极大地扩展了 Agent 的感知与操作空间,其核心模型在 open-weight 类别中达到了 SOTA 水平。

TL;DR

未来的 AI 不应只是被动响应指令的对话框,而应是潜伏在用户数字世界中的“全天候助理”。华为与北理工等团队联合发布的 Claw-Anything 填补了 Agent 评测的空白。它模拟了长达数月的数字生活,涵盖了 40 多个后端服务及跨手机(GUI)与电脑(CLI)的操作逻辑。测试结果给当前的主流模型泼了一盆冷水:最强模型也仅能勉强通过 1/3 的复杂任务。

背景定位:从“单步任务”到“数字化人生”

当前的 Agent 评测(如 ClawBench, WildClawBench)大多关注孤立的、短流程的任务,比如“帮我发个邮件”。但在真实场景中,助理需要知道你上个月开会的纪要、你家人的生日喜好以及你不同设备间的状态。Claw-Anything 的出现,标志着 Agent 评测从 Task-orientedWorld-oriented 演进。

痛点深挖:消失的语境与冷冰冰的指令

现有的 Agent 存在三大致命缺陷:

  1. 视野狭窄:无法获取长周期的历史日志。
  2. 接口孤立:通常只能操作单一的 CLI 或浏览器,无法在手机 App 和服务器终端间横跳。
  3. 缺乏主动性:只能“拨一拨动一动”,无法根据环境变化(如会议冲突)主动提出建议。

核心机制:三维空间扩展

Claw-Anything 通过以下三个维度重塑了 Agent 的 Context:

  • Long-horizon Event Streams:提供长达 3 个月的细粒度活动记录。
  • Interdependent Backend Services:包含生活、办公等 40 多类相互关联的服务。
  • Heterogeneous Device Interfaces:同时支持安卓 Docker (GUI) 和 Linux Docker (CLI)。

三维扩展架构图

自动化数据流水线 (Methodology)

为了规模化构建这种复杂的测试环境,作者开发了一套**多轮事件注入(Multi-round Event Injection)**流水线。

  1. Persona 种子:生成初始用户画像。
  2. 迭代模拟:LLM 模拟用户每天的活动,不断在数据库中产生真实的“噪声”(如无用的草稿、过期的日程)。
  3. 任务提取:在演化的世界状态中,提取具有逻辑矛盾的复杂任务(如:邮件里说 3 点开会,但日历里 3 点已被占用,Agent 该如何决策?)。

自动化流水线流程

实验结果:巨头的“滑铁卢”

在 Claw-Anything 的严苛考验下,模型表现出现了显著下滑:

  • GPT-5.5 依然保持领先,但其 Pass@1 仅为 34.5%Pass^3(连续三次成功率)仅为 20.0%
  • 实验发现,性能随 Context 长度、服务复杂度和噪声比例 的增加而单调下降。这说明目前的模型在“长程推理”和“抗干扰能力”上存在严重的 Inductive Bias 不足。

实验对比数据表

关键 Insight:执行精度是瓶颈

通过对失败模式(Failure Mode)的分析,作者发现模型最常掉进的坑是 Investigation-Execution Gap:即 Agent 能查到正确的 Context,但在转化为具体操作时,因操作精度不足或遗漏关键源信息而失败。

总结与价值

Claw-Anything 不仅仅是一个挑战,它更提供了一套 2,000 个环境的基础训练设施。通过在这些复杂环境下微调,Qwen3.5-27B 获得了 23.7% 的大幅提升。这告诉我们,要让 Agent 真正走进生活,单纯堆参数是不够的,还需要在充满“烟火气”和“琐碎噪声”的真实数字史料中浸泡(Pre-train/Fine-tune)。

未来的个人助理,正从一个“工具”变成一个“数字孪生体”,而 Claw-Anything 正是衡量这一进化程度的标尺。

发现相似论文

试试这些示例

  • 查找在 Transformer 架构中处理超长上下文(如 100k+ tokens)时,如何保持 Agent 对关键信息召回性能的最前沿研究。
  • 哪篇论文最早探讨了 LLM Agent 在 CLI 和 GUI 混合环境下进行跨设备任务编排的理论框架,Claw-Anything 与其有何承袭关系?
  • 针对主动型个人助理(Proactive Assistant),目前有哪些研究通过强化学习或偏好对齐(RLHF)来降低 Agent 的误操作率?
目录
Claw-Anything:打破孤岛,构建全知全能的数字化个人助手
1. TL;DR
2. 背景定位:从“单步任务”到“数字化人生”
3. 痛点深挖:消失的语境与冷冰冰的指令
4. 核心机制:三维空间扩展
4.1. 自动化数据流水线 (Methodology)
5. 实验结果:巨头的“滑铁卢”
5.1. 关键 Insight:执行精度是瓶颈
6. 总结与价值