AI代理能否通过用户界面交互,降低使用高级AI计算机操作代理的门槛?

与用户界面交互的AI智能体可以降低使用高级AI的门槛,但现有证据表明,在处理复杂任务时,它们仍需要人类监督。

直接答案

是的,能够与用户界面(UI)交互的AI智能体可以降低使用高级AI的门槛,让你用自然语言指挥软件,而不是逐层点击菜单。例如,像CogAgent这样的模型可以直接从截图中导航屏幕,在网络和安卓任务上表现优于基于文本的方法[2]。但证据好坏参半:2026年的一项综述发现,即使是最优秀的编程智能体也只能解决约23%的真实世界任务,而一项随机试验显示,AI使专家开发者的效率降低了19%[1]。因此,尽管UI智能体让AI更易用,但它们尚不足以可靠地取代人类判断——尤其是在复杂或高风险的操作中[5]

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

什么是UI智能体,它们如何让AI更易用?

UI代理是一种人工智能系统,能够像人一样查看并操作电脑或手机屏幕——点击按钮、输入文字、读取菜单。你无需了解某个特定应用的使用方法,只需告诉代理你想要什么,它就能自行规划操作步骤。这意义重大,因为这意味着你不需要学习复杂的软件或编写代码,只需描述目标即可。例如,视觉语言模型CogAgent能够截取屏幕截图,理解屏幕上细小的文字和按钮,从而在操作PC和Android界面时,比依赖读取底层HTML代码的方法表现更佳[2]。这直接降低了使用门槛:操作代理无需任何技术知识。

这一转变更为深远:一些研究者认为,随着智能体能力不断增强,传统用户界面——即我们今天使用的屏幕和按钮——在许多任务中可能变得不再那么必要[4]。我们或许不再为人类设计界面,而是为智能体设计界面,使其更利于自动化操作[3]。这并不意味着用户界面会一夜之间消失,而是表明使用AI的门槛正从“学会操作界面”转向“表达你的意图”。

它真的能可靠工作吗?证据令人清醒。

简短的回答是:它适用于简单任务,但对于复杂、现实世界的工作,它还不够可靠。一项2026年对AI编程代理的系统综述发现,在过滤掉测试数据污染后,最佳模型在标准基准测试(SWE-bench)上仅解决了21.8%–25.9%的任务,而在更难的版本上,顶尖模型也只达到了23.3% [1]。这意味着在约四分之三的现实任务中,代理会失败。更令人担忧的是,该综述中的一项随机对照试验显示,AI辅助使专家开发者的速度降低了19%——尽管开发者们认为它帮了忙 [1]。因此,虽然UI代理可以降低启动任务的门槛,但它们尚不能保证成功或速度。

同一篇综述还发现,AI生成的代码经常包含安全漏洞(出现概率为24%–40%),并且智能体常常“幻觉”出不存在的软件包(出现概率为5%–22%)[1]。这意味着,在没有人工监督的情况下使用智能体,可能会引入严重的错误或安全风险。作者总结道,目前完全自主的开发尚不可行,并建议采用“人在回路”的方式,即由人工审查并批准智能体的操作[1]

让智能体自行点击操作有哪些风险和局限?

一个主要风险在于,智能体可能会在未完全理解后果的情况下执行具有风险性或不可逆的操作——例如删除文件或发送电子邮件。研究人员已开发出一套移动界面操作影响的分类体系,并发现即便是先进的大语言模型(LLMs)也难以准确分类细微或复杂的影响[5][6]。这意味着智能体可能意识不到,一个看似简单的操作也可能带来严重的副作用。同一批研究表明,使用结构化的分类体系可以改善模型对影响的推理能力,但显著的差距依然存在[5][6]

另一个限制是,当前的智能体往往被设计成模仿人类行为,而这对它们来说效率并不高。2025年的一篇论文提出,将智能体用作“裁判”,专门针对智能体的效率来评估和重新设计界面,而非以人类审美为标准[3]。这可能会让智能体更加可靠,但该研究仍处于早期阶段。归根结底:尽管UI智能体能降低使用AI的门槛,但它们目前还不足以安全可靠到可以完全无人监督地运行,尤其是在高风险任务中。你仍然需要人类参与其中,以发现错误并防止危害发生。

关于这些来源

这个回答基于6项研究(2篇同行评审,4篇预印本)——发表于2024年至2026年,其中6项为2024年或之后发表,合计被引用110次——这些研究是从7项通过质量筛选的研究中选出的最相关者,而这7项研究又源自从超过5亿篇论文的数据库中检索出的41篇文献。

本文引用的文献

1

迈向自主AI驱动的软件开发:关于智能体系统实证证据的系统综述(2022—2026)

一项2026年对31项研究的系统综述发现,在过滤掉解决方案泄漏后,最佳编码代理仅解决了SWE-bench任务的21.8%至25.9%,而一项随机对照试验显示,AI使专家开发者的速度降低了19%,尽管他们自认为AI有所帮助。

2

CogAgent:面向GUI智能体的视觉语言模型

CogAgent是一个拥有180亿参数的视觉语言模型,能够以1120x1120的分辨率处理截图,并在PC和Android图形用户界面导航基准测试(Mind2Web和AITW)中优于基于文本的方法。

3

生成式用户界面的计算机使用智能体评判

一篇2025年的论文提出了AUI-Gym基准,包含52个应用和1560项任务,并倡导一种Coder-CUA协作模式,其中智能体充当评判者,以重新设计界面来提升智能体效率,其成功与否以任务可解决性而非视觉吸引力来衡量。

4

用户界面的终结与智能体的崛起

一篇2025年的概念性论文认为,AI智能体(人类、应用、安全与问责追踪智能体)将接管许多业务任务,从而加快工作速度并降低成本,同时也会取代部分岗位并创造新的就业机会。

5

从交互到影响:迈向更安全的AI智能体——理解与评估移动UI操作影响

一项2025年的研究开发了移动界面操作影响的分类体系,并发现借助该分类体系,大语言模型对细微影响的分类能力有所提升,但在复杂类别的分类上仍存在显著差距。

6

从交互到影响:通过理解与评估移动端UI操作影响,迈向更安全的AI智能体

2024年的一篇预印本(作者与[5]相同)同样表明,大语言模型难以理解移动界面操作在现实世界中的影响,而分类法虽能增强推理能力,却无法完全弥合这一差距。