cotomi Act:不仅是执行者,更是能通过“察言观色”进化的数字同事
cotomi Act: Learning to Automate Work by Watching You
本文推出了 cotomi Act,一个基于浏览器的计算机操作智能体(CUA)。该系统通过创新的 Agent Scaffold 和“行为转知识”流水线,不仅在 WebArena 基准测试中以 80.4% 的成功率超越了人类基线(78.2%),还能通过观察用户日常操作自动提炼组织级知识。
TL;DR
NEC 提出的 cotomi Act 是一款突破性的浏览器智能体。它不仅在执行力上超越了人类专家基准(WebArena SR: 80.4% vs 78.2%),更核心的创新在于它引入了一个共享知识空间(Shared Knowledge Workspace)。通过静默观察用户的浏览行为,它能自动总结出“不成文”的公司规章和操作偏好,彻底解决了 AI 助手不懂“潜规则”的行业难题。
痛点深挖:为什么 AI 助手干不好“公司活”?
当前的 Computer-Using Agents (CUAs) 即使推理能力再强,也常常在实际工作中碰壁。其核心矛盾在于:
- 性能瓶颈:复杂的 Web 页面拥有海量的 DOM 节点,每一步操作都把整个页面塞给模型,很快就会导致 Context Window 溢出,让 AI 变得“健忘”且“迟钝”。
- 知识断层:公司里的很多事情是没有文档的。比如,“申请流程需要谁审批?”或者“这个内部缩写代表什么?”。传统的 RAG 需要现成的文档,但这些“默会知识”通常只存在于员工的日常操作中。
核心架构:强执行力 + 进化型大脑
cotomi Act 的架构展示了如何将“执行(Execution)”与“感知(Perception)”分离并有机结合。

1. 极致高效的 Agent Scaffold
为了让智能体跑得稳、跑得快,作者设计了四种关键机制:
- Verbal-diff(语言差分):不再复述整个页面,而是用自然语言描述“什么变了”(例如:“提交按钮现在变绿了”)。这比原始 DOM 树节省了约 3.8 倍的 Token 开销。
- Lazy Observation(惰性观察):默认只看视口内的内容,需要时再请求全局信息,响应速度提升 2.6 倍。
- Test-time Scaling:引入 Best-of-N 策略,即生成多个候选操作进行投票,并自动对复杂目标进行任务分解。
2. 行为转知识(Behavior-to-Knowledge)
这是 cotomi Act 的“点睛之笔”。它内置了一个后台 Logger,会像学徒一样观察用户的操作,并通过一个 Agentic ETL 流水线进行抽象:
- 捕获:记录屏幕截图、点击和标签切换。
- 抽象:将杂乱的日志转化为 Wiki 条目、任务状态或操作指南。
- 共享:这些知识以人类可读的形式放在“共享空间”里。重点是:用户可以修改它。这种“双向编辑”保证了人机之间的对齐。
实验战绩:超越人类 baseline
在公认的困难测试集 WebArena 上,cotomi Act 的表现令人惊艳。

- 执行力突破:通过 Scaffold 优化,cotomi Act 在 179 个验证任务中达到了 80.4% 的成功率,正式超过了 78.2% 的人类水平。
- 知识积累的威力:在 WorkArena 环境下的测试显示(见下图),当智能体掌握了 100% 的领域相关行为知识后,成功率有显著的阶跃式提升。特别是当这些知识被抽象为“脚本(Scripts)”时,即使覆盖率较低也能提供稳定的帮助。

深度洞察:从“无状态”到“有情境”
cotomi Act 最大的启示是改变了我们对“智能体内存”的看法。传统的智能体内存往往是一个黑盒(如向量数据库),用户难以察觉其逻辑偏差。而 cotomi Act 将其转化为 Boundary Objects(边界对象)——即 Wiki 和任务板。这不仅是智能体检索(RAG)的来源,更是人机协作的接口。
局限性探讨: 尽管表现强劲,但在真实复杂的办公环境下,如何保护隐私(PII 掩码虽有提及,但面对敏感屏幕内容仍有挑战)以及如何处理用户偶尔的错误操作(即防止智能体学坏)仍是未来大规模部署前需要解决的难题。
总结
cotomi Act 证明了:一个顶级的 AI 同事,不仅要会在网页上点点点,更要能通过“看你工作”来学习那些无法言说的组织智慧。这种“行为驱动的知识外化”路径,或许是通往通用计算机辅助(GAI on CUA)的关键里程碑。
