为什么带对话的模拟是你应该跑的第一项测试
最实际的第一步,是在模拟环境中测试智能体,让它必须与一个类似人类的伙伴对话才能完成任务。TEACh数据集基于模拟家庭中超过3000段人机对话构建,表明像“煮咖啡”或“准备早餐”这样的真实任务,要求智能体主动提问并获取额外信息,而不仅仅是遵循固定计划[4]。因此,你的测试应包含一个人类或模拟人类提供不完整或模糊的指令,并衡量智能体是否会主动澄清疑问、从错误中恢复。
为什么要先做仿真?因为它能让你以低成本、高安全性地运行大量场景,而且它迫使你在冒险使用实体机器人之前,先定义好交互协议。TEACh基准测试专门评估对话理解、语言落地和任务执行——这三项技能恰恰是真实人际交互中最容易出问题的环节[4]。如果智能体在仿真环境中连模糊指令都处理不了,那它在现实世界里就更不可能做到了。
先用虚拟化身测试,再上实体机器人——人的行为会不一样
2023年一项关于人机谈判的研究发现,人们的行为会因智能体是实体机器人还是屏幕上的虚拟化身而有所不同。该研究中,当参与者与虚拟化身谈判时,社会福利——即双方的整体收益——显著高于与实体机器人谈判时,并且在虚拟情境下参与者表现出更多合作性行为[3]。这意味着实体机器人实际上可能让人更具防御性或竞争性,因此先用虚拟化身进行测试,能让你对智能体的社交能力有一个更乐观的评估,而且更安全、成本也更低。
但同一项研究发现,参与者认为实体机器人更具人性化特征[3]。因此,如果你的目标是部署实体机器人,最终必须用真实形态进行测试,因为物理存在会改变互动方式。实际启示是:早期迭代阶段使用虚拟化身,最终验证阶段再转向实体机器人,并预期人们会更认真对待实体机器人——这究竟是好事还是坏事,取决于你的具体任务。
别忘了模糊指令与多智能体协调
真实的人类指令往往带有歧义——其中省略了人们通常会默认的隐含细节。2022年一项关于具身多智能体任务规划的研究明确处理了这一问题,让机器人推理诸如“摆好桌子”这类高层级指令,而其中部分目标物体并未被点名[5]。该研究表明,智能体需要借助外部知识和视觉感知来消除歧义,然后在多个智能体之间动态分配子任务[5]。因此,你的测试应包含信息缺失的指令,并检查智能体能否填补这些空白,以及在任务涉及多个智能体时能否与其他智能体进行协调。
这一点尤为重要,因为该研究表明,同一模型在仿真和物理场景中都能有效运行,从而避免了臭名昭著的“仿真到现实”差距[5]。这意味着,你可以在仿真环境中测试歧义处理能力,并确信结果能迁移到现实世界——前提是你在测试中纳入了与实际使用中预期相同的歧义指令类型。
谨慎衡量信任——解释可能引发过度依赖
当你用真人进行测试时,不仅需要衡量任务成功率,还要衡量信任度。2023年一项涉及215名参与者的研究发现,在AI推荐系统中加入解释可以提升信任,但仅在特定条件下成立[1]。具体而言,特征重要性解释比反事实解释更能增强信任;而当系统性能无法保证时,解释会导致过度依赖——人们过度信任了系统[1]。这是一个警示:如果你的智能体解释其行为,你必须测试这些解释是否会让人们过度信任它,尤其是在智能体可能出错的情况下。
研究还发现,系统性能对信任的影响比解释或风险水平更强[1]。因此,你能做的最重要的事情是让智能体表现可靠;解释则是次要的。在测试中,要包含智能体失败的场景,并观察人们是否仍然过度信任它——这是实际部署中的一个危险信号。
关于这些资料来源
本回答基于5项同行评审研究——发表于2022年至2023年间,其中1项发表于Q1期刊,合计被引用1265次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的29篇文献。
本文引用的文献
AI信任:可解释的人工智能能否增强合理信任?
在一项涉及215名参与者的研究中,解释仅在特定条件下增强了对AI推荐系统的信任;当系统性能无法保证时,解释反而导致过度依赖。性能对信任的影响比解释或风险更为显著。
生成式智能体:人类行为的交互式模拟
生成式智能体——基于大语言模型的人类行为模拟——在沙盒环境中展现出了可信的个体与社会行为,其中观察、规划与反思各自对可信度起到了关键作用。
智能体具身化对人机谈判的影响
在人机谈判实验中,使用虚拟化身时的社会福利显著高于实体机器人,参与者在虚拟环境中表现出更多合作性举动,并且他们认为实体机器人更具类人特征。
TEACh:任务驱动的具身对话智能体
TEACh数据集包含了超过3000段在模拟环境中进行家务任务的人机交互对话,所提出的基准测试评估了对话理解、语言 grounding 和任务执行能力。
基于模糊指令的具身多智能体任务规划
一个具身多智能体任务规划框架利用外部知识和视觉感知来解决模糊指令并分配子任务,并在仿真和物理场景中均得到验证,避免了仿真到现实的迁移问题。
