[ICLR 2026] AI 智能体能达成共识吗?揭秘 LLM 群体在恶意干扰下的脆弱性
Can AI Agents Agree?
本文提出了 A2A-Sim 模拟框架,系统评估了基于 LLM 的智能体在同步全连接网络中的拜占庭共识(Byzantine Consensus)表现。研究发现,即便是 Qwen3-14B 等高性能模型,在面对恶意节点或大规模群体时,其达成有效共识的能力依然脆弱,主要表现为活性(Liveness)丧失导致的任务超时。
TL;DR
随着大语言模型(LLM)被广泛应用于多智能体协作(如自动编程、联合规划),一个核心安全问题浮出水面:如果群体中潜伏着“坏人”,AI 们还能达成一致吗?苏黎世联邦理工学院(ETH Zurich)的最新研究表明:很难。 即使在没有利益冲突的简单场景下,LLM 智能体在面对恶意节点时极易丧失协作能力,且群体越大,协调越乱。
背景定位:从确定性算法到随机性 AI
传统的“拜占庭容错(BFT)”是分布式系统的基石,旨在确保系统在部分节点故障或作恶时仍能正常运行。然而,当节点核心从简单的代码变成了复杂、感性且具有随机性的 LLM 时,经典的数学证明失效了。本文是首批系统性探讨 LLM 智能体在对抗性环境下的共识能力 的工作。
核心挑战:为什么 AI 达成共识这么难?
作者指出,现有基于 LLM 的协作主要面临三个痛点:
- 群体规模困境:随着 Agent 数量 增加,通信复杂度和噪声呈指数级上升。
- 安全性与活性的权衡:仅仅告诉 AI “可能有坏人”,就会让 AI 变得过度谨慎,导致对话陷入僵局。
- 缺乏确定性保证:LLM 的 Prompt 驱动特性使得它们在处理逻辑冲突时不如传统算法健壮。
实验设计:A2A-Sim 模拟器
研究者构建了一个名为 A2A-Sim 的全连接网络模拟环境。
- 任务:所有诚实智能体必须从初始的提议值中选定一个,并达成 2/3 以上的投票一致。
- 变量:模型大小(Qwen3-8B vs 14B)、群体规模(4, 8, 16 节点)、拜占庭节点比例。
- 威胁模型:恶意智能体可以发送虚假的提议和理由,意在干扰、延迟或误导共识。
图 1:同步全连接网络中的拜占庭共识游戏流程,展示了智能体如何通过广播提议和理由进行决策。
核心发现:AI 的“社会协作”极其脆弱
1. 规模是共识的敌人
实验显示(见图 2),即便在 环境中完全没有坏人 (B=0) 的理想状态下,共识也并非百分之百成功。
- 当规模从 4 人增加到 16 人,有效共识率从 46.6% 骤降至 33.3%。
- 模型越大越聪明:Qwen3-14B 的成功率(67.4%)远高于 8B 模型(15.8%)。
图 2:在无恶意节点情况下,不同模型大小和群体规模的共识表现。
2. “疑心病”拖垮了效率
这是一个有趣的发现:如果在 Prompt 中提醒诚实智能体“可能有拜占庭节点存在”,即便是环境其实很安全,智能体的表现也会变差。Qwen3-14B 在被提醒后,收敛速度变慢,失败率大幅增加。这种“疑心病”导致了严重的 活性丧失(Liveness Loss)。
3. 恶意节点的“致命一击”
只需加入 1 个 恶意节点,原有的共识体系就会迅速崩塌(见图 3)。令人惊讶的是,恶意节点通常不需要通过复杂的数值误导来破坏系统,它们只需要“不停地说话”或“改变主意”,就能让诚实节点因无法达成 2/3 多数票而直到超时(Timeout)。
图 3:拜占庭节点数量对 Qwen3-14B 共识成功率的影响,可见 B=1 时成功率已显著下降。
深度洞察:活性 vs. 有效性
在分布式算法中,我们担心的是“错误的决定”(有效性丧失)。但在 LLM 智能体世界里,更现实的威胁是**“做不出决定”**。
如下图 4 所示,底部的轨迹显示了在受到警告和干扰时,智能体的提议值(Scalar Proposals)如何在多轮对话中摇摆不定,最终无法收敛。这说明当前的 LLM 在面临社会冲突或对抗时,缺乏足够的稳健性来强制执行协议。
图 4:诚实智能体的提议随时间变化的轨迹。上方为理想状态,下方为受干扰后的混沌状态。
总结与展望
这篇论文为当前火热的 Multi-Agent 方向敲响了警钟:共识不是免费的午餐。
- 局限性:本研究仅测试了单一的恶意策略和特定模型族,现实中的对抗可能更加隐蔽(如共谋攻击)。
- 启示:未来的多智能体系统必须集成非 LLM 的硬性约束(如加密投票、基于信誉的权重分配或经典的 PBFT 衍生协议),而不能仅仅指望 AI 们能通过“聊天”解决所有冲突。
AI 智能体要想像人类社会一样高效、安全地协作,还有很长的路要走。
