cotomi Act:不仅是执行者,更是能通过“察言观色”进化的数字同事

cotomi Act: Learning to Automate Work by Watching You

总结
问题
方法
结果
要点
摘要

本文推出了 cotomi Act,一个基于浏览器的计算机操作智能体(CUA)。该系统通过创新的 Agent Scaffold 和“行为转知识”流水线,不仅在 WebArena 基准测试中以 80.4% 的成功率超越了人类基线(78.2%),还能通过观察用户日常操作自动提炼组织级知识。

TL;DR

NEC 提出的 cotomi Act 是一款突破性的浏览器智能体。它不仅在执行力上超越了人类专家基准(WebArena SR: 80.4% vs 78.2%),更核心的创新在于它引入了一个共享知识空间(Shared Knowledge Workspace)。通过静默观察用户的浏览行为,它能自动总结出“不成文”的公司规章和操作偏好,彻底解决了 AI 助手不懂“潜规则”的行业难题。

痛点深挖:为什么 AI 助手干不好“公司活”?

当前的 Computer-Using Agents (CUAs) 即使推理能力再强,也常常在实际工作中碰壁。其核心矛盾在于:

  1. 性能瓶颈:复杂的 Web 页面拥有海量的 DOM 节点,每一步操作都把整个页面塞给模型,很快就会导致 Context Window 溢出,让 AI 变得“健忘”且“迟钝”。
  2. 知识断层:公司里的很多事情是没有文档的。比如,“申请流程需要谁审批?”或者“这个内部缩写代表什么?”。传统的 RAG 需要现成的文档,但这些“默会知识”通常只存在于员工的日常操作中。

核心架构:强执行力 + 进化型大脑

cotomi Act 的架构展示了如何将“执行(Execution)”与“感知(Perception)”分离并有机结合。

模型架构图

1. 极致高效的 Agent Scaffold

为了让智能体跑得稳、跑得快,作者设计了四种关键机制:

  • Verbal-diff(语言差分):不再复述整个页面,而是用自然语言描述“什么变了”(例如:“提交按钮现在变绿了”)。这比原始 DOM 树节省了约 3.8 倍的 Token 开销。
  • Lazy Observation(惰性观察):默认只看视口内的内容,需要时再请求全局信息,响应速度提升 2.6 倍。
  • Test-time Scaling:引入 Best-of-N 策略,即生成多个候选操作进行投票,并自动对复杂目标进行任务分解。

2. 行为转知识(Behavior-to-Knowledge)

这是 cotomi Act 的“点睛之笔”。它内置了一个后台 Logger,会像学徒一样观察用户的操作,并通过一个 Agentic ETL 流水线进行抽象:

  • 捕获:记录屏幕截图、点击和标签切换。
  • 抽象:将杂乱的日志转化为 Wiki 条目、任务状态或操作指南。
  • 共享:这些知识以人类可读的形式放在“共享空间”里。重点是:用户可以修改它。这种“双向编辑”保证了人机之间的对齐。

实验战绩:超越人类 baseline

在公认的困难测试集 WebArena 上,cotomi Act 的表现令人惊艳。

实验结果对比

  • 执行力突破:通过 Scaffold 优化,cotomi Act 在 179 个验证任务中达到了 80.4% 的成功率,正式超过了 78.2% 的人类水平。
  • 知识积累的威力:在 WorkArena 环境下的测试显示(见下图),当智能体掌握了 100% 的领域相关行为知识后,成功率有显著的阶跃式提升。特别是当这些知识被抽象为“脚本(Scripts)”时,即使覆盖率较低也能提供稳定的帮助。

知识覆盖率与成功率关系图

深度洞察:从“无状态”到“有情境”

cotomi Act 最大的启示是改变了我们对“智能体内存”的看法。传统的智能体内存往往是一个黑盒(如向量数据库),用户难以察觉其逻辑偏差。而 cotomi Act 将其转化为 Boundary Objects(边界对象)——即 Wiki 和任务板。这不仅是智能体检索(RAG)的来源,更是人机协作的接口。

局限性探讨: 尽管表现强劲,但在真实复杂的办公环境下,如何保护隐私(PII 掩码虽有提及,但面对敏感屏幕内容仍有挑战)以及如何处理用户偶尔的错误操作(即防止智能体学坏)仍是未来大规模部署前需要解决的难题。

总结

cotomi Act 证明了:一个顶级的 AI 同事,不仅要会在网页上点点点,更要能通过“看你工作”来学习那些无法言说的组织智慧。这种“行为驱动的知识外化”路径,或许是通往通用计算机辅助(GAI on CUA)的关键里程碑。

发现相似论文

试试这些示例

  • 查找最近其他关于如何减少浏览器智能体在长程任务中 Context Window 压力或进行观察值压缩(Observation Reduction)的研究论文。
  • 哪篇论文最早探讨了计算机操作智能体(Computer-Using Agent)从单次任务执行向具备持久化内存(Persistent Memory)转变的架构设计?
  • 调研除了 WebArena 之外,目前针对企业内部流程(如 ServiceNow、Salesforce)的浏览器智能体基准测试(Benchmarks)及其最新 SOTA 方法。
目录
cotomi Act:不仅是执行者,更是能通过“察言观色”进化的数字同事
1. TL;DR
2. 痛点深挖:为什么 AI 助手干不好“公司活”?
3. 核心架构:强执行力 + 进化型大脑
3.1. 1. 极致高效的 Agent Scaffold
3.2. 2. 行为转知识(Behavior-to-Knowledge)
4. 实验战绩:超越人类 baseline
5. 深度洞察:从“无状态”到“有情境”
6. 总结