安全将成为核心评估指标,而非事后补救
当今的网络任务测试平台大多只检验智能体能否完成任务,而不关注它是否会被诱导做出有害行为。然而,Datta 等人提出的 2026 年威胁模型表明,浏览器智能体容易受到 20 种不同攻击的影响,其中包括 10 种经典的网络社会工程学手段——当智能体受到不可信页面内容影响时,这些手段会以放大的形式重新出现 [1]。这意味着,仅检查任务成功与否的测试平台,会漏掉那些智能体被操纵点击恶意链接或泄露数据的关键失败场景。
同一项研究发现,这些攻击在四家主要大语言模型供应商中均可复现,因此这并非单一模型的特性问题[1]。未来两年内,预计测试框架会将对抗性场景——例如包含隐藏指令或欺骗性界面的页面——作为标准实践纳入其中。这将迫使智能体设计者在智能体被信任承担现实世界任务之前,就构建防御机制,例如根据用户意图核验操作行为。
工具框架将推动智能体超越简单浏览,去处理人们避之不及的琐事
当前大多数基准测试都聚焦于普通浏览场景,但真实用户需要智能体处理繁琐的多步骤任务,比如填写表单或跨多个页面比较价格。WebChoreArena 是2025年推出的一个包含532项任务的基准测试,专门针对这类“杂务”进行测试,并增加了三大挑战:海量记忆(提取大量信息)、精确计算以及跨页面的长期记忆 [2]。即便是测试中表现最好的模型 Gemini 2.5 Pro,与更简单的 WebArena 基准相比,仍显示出“相当大的提升空间”,这意味着这些任务确实更具难度 [2]。
这之所以重要,是因为工具链评估将越来越多地使用此类基准来衡量进展。随着模型在WebChoreArena上的表现提升,我们将看到能够可靠处理人们厌恶的繁琐工作的智能体——但这一差距也表明,当前的智能体在复杂任务上尚未准备好投入实际应用。工具链设计者将需要添加诸如更好的内存管理和逐步验证等功能,以缩小这一差距。
关键差异在于“框架”本身——而非仅靠模型
一篇2026年的立场文件指出,智能体的可靠性取决于“控制层”——即控制允许哪些操作、如何管理状态以及如何处理失败的代码——而不仅仅是底层的大语言模型[3]。这标志着一种观念转变,即不再认为更好的模型自动意味着更好的智能体。该文件提出了一个框架(控制、自主性、运行时),并指出许多已报告的智能体性能提升可能具有“控制层敏感性”,这意味着同一模型可能因控制层的构建方式不同而表现迥异[3]。
对用户而言,这意味着在未来两年里,我们会看到更多对“框架工程”的重视——比如加入安全检查、记忆系统和错误恢复机制——以此作为提升智能体性能的手段。评估时不仅需要报告模型本身,还要说明框架设计,这样才能确保比较的公平性和可复现性。这是个好消息:它意味着进步可以来自更好的工程实践,而不只是等待下一代模型的发布。
关于这些来源
这个回答基于3项研究(均为预印本)——发表于2025年至2026年,其中3项为2024年或之后——从3项通过质量筛选的研究中选出最相关的,这些研究来自从超过5亿篇论文的数据库中检索到的29篇文献。
本文引用的文献
WAAA!对抗智能体浏览器的网络 adversaries
提出了首个面向智能体浏览器的网络威胁模型,识别出20种攻击(其中18种已实现),并表明10种经典网络威胁以放大形式重新出现,且这些失败在4家主要大语言模型供应商中重复出现。
WebChoreArena:在真实繁琐的网页任务中评估网页浏览代理
提出了WebChoreArena基准测试,包含532项繁琐任务,并发现即使是最优模型(Gemini 2.5 Pro)相较于更简单的WebArena仍有显著提升空间,凸显了记忆与计算任务带来的额外难度。
语言智能体的驾驭工程:驾驭层作为控制、能动性与运行时
认为控制层(控制、代理、运行时)对智能体的可靠性至关重要,且许多已报告的智能体性能提升可能对控制层敏感,而非纯粹由模型驱动,因此提出HarnessCard用于报告。
