什么算成功或失败?先从定义可衡量的结果开始,而不仅仅是任务完成度。
诊断的第一步是选择既能反映任务目标,又能体现系统在攻击下健康状况的指标。在对抗性环境中,系统或许仍能完成任务,但可能付出难以接受的安全或信任代价。例如,[1]测量了自动驾驶汽车的碰撞率和平均速度:一种对抗性策略将碰撞率推高至62%,并将平均速度从25米/秒降至21.73米/秒——这明显是安全性和效率上的失败。[2]将信任度作为关键指标引入,结果显示,在攻击下,一种贪婪启发式算法仅保留了最终信任度的29%,而基于QUBO的优化器则保持了91%。
这些指标并不能互相替代:一个系统可能在任务完成度上得分很高,但在信任度或安全性上却表现不佳,因此团队应同时追踪多个维度。[2] 还追踪了在欺骗场景下的任务完成情况——贪婪型智能体一项任务也未完成,而优化器则完成了24.2%——这表明单一指标可能掩盖另一个维度上的灾难性失败。因此,诊断框架应至少包含一项性能指标(例如任务完成度、速度)和一项韧性指标(例如信任度、碰撞率)。
如何判断哪里出了问题?对攻击类型进行分类,并针对性地测试防御措施。
故障往往源于特定的攻击途径——例如欺骗性信息、GPS欺骗或对抗性策略——而每种途径都需要不同的诊断视角。[1]训练了两种对抗性策略(碰撞和速度)来干扰协作驾驶策略,从而隔离出行为中易受攻击的具体方面。[4]聚焦于隐蔽的投毒攻击,这类攻击将恶意建议隐藏在差分隐私噪声中,难以通过标准异常检测发现。[2]模拟了伪造的高优先级任务、路径阻塞和通信中断,表明不同类型的攻击会以不同方式削弱信任和任务完成度。
一旦识别出攻击类型,你就可以测试自己的防御是否真正堵住了漏洞。[4]的RAMPART在每个节点使用GAN(生成对抗网络)在无标签数据下过滤恶意建议,在30%攻击比例的高流量场景中实现了96.3%的准确率和0.852的F1分数。[1]发现对抗训练——即在训练期间让策略暴露于攻击——能将针对一种对手的碰撞率降低一半,并对另一种对手实现0%碰撞。这表明诊断应包含“防御探针”:对已防御和未防御版本运行相同攻击,以观察系统在哪些环节仍会失效。
为何有些系统失败,而另一些却成功?关键在于推理是局部的还是全局的。
这些研究中反复出现的一个规律是,依赖局部、贪婪决策的系统在遭受攻击时比采用全局优化的系统更为脆弱。[2] 直接将一种贪婪启发式方法与基于QUBO的全局优化器进行了对比:优化器在欺骗攻击下保留了91%的信任度,而贪婪方法仅为29%;任务完成率方面,优化器完成了24.2%的任务,而贪婪方法则为0%。原因在于,全局推理能够考虑信任度的下降以及相互依赖的约束条件,而局部决策则容易被对抗性噪声所困住。
然而,仅靠全局推理还不够——还必须与安全约束相结合。[3]提出了一种针对基于LLM的多智能体系统的“事务性无回归”(TNR)安全规范,确保任何探索或迭代都不会使系统状态退化。这使得他们的STRATUS系统在两个基准测试中,故障缓解成功率比最先进的智能体至少提升了1.5倍。因此,诊断时应问:系统是否具备全局视角,是否在探索过程中强制执行安全不变量?如果没有,那很可能就是故障点。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的59篇文献。
本文引用的文献
针对多智能体自主协同驾驶策略的对抗性深度强化学习攻击
对抗策略在协同驾驶场景中将碰撞率提升至62%,并将平均速度从25米/秒降至21.73米/秒;然而,对抗训练在面对一种对抗者时将碰撞率降低了一半,而在面对另一种对抗者时实现了0%的碰撞率。
对抗性多智能体系统中基于量子优化的信任感知任务分配
在针对欺骗与路径阻断等攻击的100轮模拟中,基于QUBO的全局优化器保持了91%的最终信任度和24.2%的任务完成率,而贪婪启发式算法仅维持了29%的信任度和0%的完成率。
STRATUS:面向现代云自主可靠性工程的多智能体系统
STRATUS是一个基于LLM的多智能体系统,具备事务性无回归安全规范,在两个基准测试(AIOpsLab和ITBench)中,其故障缓解成功率比最先进的SRE智能体至少提升了1.5倍。
RAMPART:通过交通领域中的对抗性抵抗强化自主多智能体防护
RAMPART是一种基于GAN的防御方法,以无监督方式过滤恶意建议,在30%投毒攻击比例且流量繁重的条件下,达到了96.3%的准确率和0.852的F1分数。
DOVA:以深思为先的多智能体编排框架,用于自主研究自动化
DOVA是一种以 deliberation 为先的多智能体编排方案,在简单任务上将推理成本降低了40%至60%,同时保持了深度推理能力。其跨七种配置的消融研究表明,组件选择会影响答案置信度、来源覆盖率和词元效率。
