将代理自主性与任务的阶段和可预测性相匹配
第一步是停止将AI智能体视为完全自主的统一体。相反,应根据工作周期的阶段来设定其控制级别——就像人类团队在任务变得更加正式或可预测时调整行为一样。2022年一项涉及103名参与者的研究,利用事件响应场景表明,根据正式流程程度和任务可预测性来分配自主级别,能够同时提升团队绩效和凝聚力[2]。在实践中,这意味着在常规、定义明确的步骤中让智能体更独立地行动,但在模糊或高风险阶段则将其拉回人类监督之下。
这种自适应方法并非锦上添花,而是高效人机协作团队的关键所在。同一项研究发现,动态的、类人的适应机制至关重要——静态的自主级别会导致摩擦并降低信任度[2]。因此,在设计工作流程时,应明确界定智能体何时可以独立行动,何时必须与人类确认。
让智能体担任评审者,而非仅执行者,以改进UI设计
负责任地使用AI智能体的一种强大方式是让它们评估自己所操作的界面,而不仅仅是点击浏览。2025年,一个名为AUI-Gym的框架在52个应用和1560个合成任务中测试了这一理念,结果表明,“编码员”智能体可以设计网站,而“计算机使用智能体”(CUA)则充当评判者,以任务可解决性和导航成功率而非视觉吸引力来衡量成功[1]。这将目标从人类审美转向智能体原生效率,而这正是自动化工作流真正重要的所在。
该框架还包含一个“CUA仪表盘”,可将多步导航历史压缩为可视化摘要,为人类设计师提供可解释的反馈,以支持迭代式重新设计[1]。这是利用智能体反馈来同时提升智能体自身性能与底层用户界面的一个具体实例,同时始终将人类保留在最终决策环节中。
在多智能体团队中保持人类问责制
随着团队扩展至包含多个专业化智能体——例如2025年一份商业分析中描述的人类智能体、应用智能体、安全智能体和问责追踪智能体——监督缺失的风险也随之增加[3]。该论文指出,尽管这些智能体能够接管许多任务,它们也为人类创造了新的角色,就像电子表格改变了会计行业而非将其淘汰一样[3]。关键在于嵌入问责机制,例如设立一个专门的智能体来追踪行动与决策,确保每一个自动化步骤都能追溯到具体的人类负责人。
这与2026年关于构建智能体AI研究团队的研讨会方法一致,该研讨会强调在人类控制下编排多个智能体,用于文献综述、分析和写作[4]。研讨会强调,人类控制并非可有可无,而是可靠且学术上站得住脚的工作流程的基础。因此,在设计你的智能体团队时,明确为每个关键决策点指派一名人类监督者或问责智能体。
关于这些来源
这个回答基于4项研究(2项经同行评审,2项为预印本),发表于2022年至2026年间,其中3项为2024年或之后发表,合计被引用86次。这些研究是从4项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的53篇文献。
本文引用的文献
生成式用户界面的计算机使用智能体评估方法
推出了AUI-Gym基准测试,包含52个应用和1,560个合成任务,并提出了Coder-CUA协作机制,其中Coder负责设计,CUA负责评判,以任务可解性和导航成功率作为指标,并配有仪表板提供可解释的反馈。
适应与克服:人类与人工智能协作中对自适应自主智能体的感知
在一项包含103名参与者的因子调查及22次后续访谈中,研究发现,根据工作周期阶段(正式流程与可预测性)赋予AI代理自主性,能够提升团队绩效与凝聚力,并且动态、类人的适应能力对于高效的人机协作团队至关重要。
用户界面的终结与智能体的崛起
文章认为,AI代理(人类、应用、安全与问责追踪器)将接管许多业务任务,但如同电子表格一样,它们会取代部分工作岗位,同时创造新的机遇,并强调问责追踪的必要性。
构建智能体AI研究团队
描述了一场关于将前沿AI系统组织为专业化研究团队的研讨会,这些团队分别负责文献综述、分析、综合、写作和验证,且全程处于人类控制之下,以确保工作流程可靠且经得起学术推敲。
