[ICLR 2026] AI 智能体能达成共识吗?揭秘 LLM 群体在恶意干扰下的脆弱性

Can AI Agents Agree?

总结
问题
方法
结果
要点
摘要

本文提出了 A2A-Sim 模拟框架,系统评估了基于 LLM 的智能体在同步全连接网络中的拜占庭共识(Byzantine Consensus)表现。研究发现,即便是 Qwen3-14B 等高性能模型,在面对恶意节点或大规模群体时,其达成有效共识的能力依然脆弱,主要表现为活性(Liveness)丧失导致的任务超时。

TL;DR

随着大语言模型(LLM)被广泛应用于多智能体协作(如自动编程、联合规划),一个核心安全问题浮出水面:如果群体中潜伏着“坏人”,AI 们还能达成一致吗?苏黎世联邦理工学院(ETH Zurich)的最新研究表明:很难。 即使在没有利益冲突的简单场景下,LLM 智能体在面对恶意节点时极易丧失协作能力,且群体越大,协调越乱。

背景定位:从确定性算法到随机性 AI

传统的“拜占庭容错(BFT)”是分布式系统的基石,旨在确保系统在部分节点故障或作恶时仍能正常运行。然而,当节点核心从简单的代码变成了复杂、感性且具有随机性的 LLM 时,经典的数学证明失效了。本文是首批系统性探讨 LLM 智能体在对抗性环境下的共识能力 的工作。

核心挑战:为什么 AI 达成共识这么难?

作者指出,现有基于 LLM 的协作主要面临三个痛点:

  1. 群体规模困境:随着 Agent 数量 增加,通信复杂度和噪声呈指数级上升。
  2. 安全性与活性的权衡:仅仅告诉 AI “可能有坏人”,就会让 AI 变得过度谨慎,导致对话陷入僵局。
  3. 缺乏确定性保证:LLM 的 Prompt 驱动特性使得它们在处理逻辑冲突时不如传统算法健壮。

实验设计:A2A-Sim 模拟器

研究者构建了一个名为 A2A-Sim 的全连接网络模拟环境。

  • 任务:所有诚实智能体必须从初始的提议值中选定一个,并达成 2/3 以上的投票一致。
  • 变量:模型大小(Qwen3-8B vs 14B)、群体规模(4, 8, 16 节点)、拜占庭节点比例。
  • 威胁模型:恶意智能体可以发送虚假的提议和理由,意在干扰、延迟或误导共识。

模型架构图 图 1:同步全连接网络中的拜占庭共识游戏流程,展示了智能体如何通过广播提议和理由进行决策。

核心发现:AI 的“社会协作”极其脆弱

1. 规模是共识的敌人

实验显示(见图 2),即便在 环境中完全没有坏人 (B=0) 的理想状态下,共识也并非百分之百成功。

  • 当规模从 4 人增加到 16 人,有效共识率从 46.6% 骤降至 33.3%。
  • 模型越大越聪明:Qwen3-14B 的成功率(67.4%)远高于 8B 模型(15.8%)。

实验结果对比 图 2:在无恶意节点情况下,不同模型大小和群体规模的共识表现。

2. “疑心病”拖垮了效率

这是一个有趣的发现:如果在 Prompt 中提醒诚实智能体“可能有拜占庭节点存在”,即便是环境其实很安全,智能体的表现也会变差。Qwen3-14B 在被提醒后,收敛速度变慢,失败率大幅增加。这种“疑心病”导致了严重的 活性丧失(Liveness Loss)

3. 恶意节点的“致命一击”

只需加入 1 个 恶意节点,原有的共识体系就会迅速崩塌(见图 3)。令人惊讶的是,恶意节点通常不需要通过复杂的数值误导来破坏系统,它们只需要“不停地说话”或“改变主意”,就能让诚实节点因无法达成 2/3 多数票而直到超时(Timeout)。

实验结果对比 图 3:拜占庭节点数量对 Qwen3-14B 共识成功率的影响,可见 B=1 时成功率已显著下降。

深度洞察:活性 vs. 有效性

在分布式算法中,我们担心的是“错误的决定”(有效性丧失)。但在 LLM 智能体世界里,更现实的威胁是**“做不出决定”**。

如下图 4 所示,底部的轨迹显示了在受到警告和干扰时,智能体的提议值(Scalar Proposals)如何在多轮对话中摇摆不定,最终无法收敛。这说明当前的 LLM 在面临社会冲突或对抗时,缺乏足够的稳健性来强制执行协议。

提议轨迹图 图 4:诚实智能体的提议随时间变化的轨迹。上方为理想状态,下方为受干扰后的混沌状态。

总结与展望

这篇论文为当前火热的 Multi-Agent 方向敲响了警钟:共识不是免费的午餐。

  • 局限性:本研究仅测试了单一的恶意策略和特定模型族,现实中的对抗可能更加隐蔽(如共谋攻击)。
  • 启示:未来的多智能体系统必须集成非 LLM 的硬性约束(如加密投票、基于信誉的权重分配或经典的 PBFT 衍生协议),而不能仅仅指望 AI 们能通过“聊天”解决所有冲突。

AI 智能体要想像人类社会一样高效、安全地协作,还有很长的路要走。

发现相似论文

试试这些示例

  • 查找最近关于提升 LLM 多智能体系统在拜占庭环境下鲁棒性的算法或框架,特别是利用区块链或加密协议的研究。
  • 追溯“拜占庭将军问题 (The Byzantine Generals Problem)”的经典论文,并对比传统分布式算法与本文中 LLM 随机策略的本质差异。
  • 探索是否有研究将具有拜占庭容错能力的 LLM 协商机制应用到自动驾驶或多无人机协同决策任务中?
目录
[ICLR 2026] AI 智能体能达成共识吗?揭秘 LLM 群体在恶意干扰下的脆弱性
1. TL;DR
2. 背景定位:从确定性算法到随机性 AI
3. 核心挑战:为什么 AI 达成共识这么难?
4. 实验设计:A2A-Sim 模拟器
5. 核心发现:AI 的“社会协作”极其脆弱
5.1. 1. 规模是共识的敌人
5.2. 2. “疑心病”拖垮了效率
5.3. 3. 恶意节点的“致命一击”
6. 深度洞察:活性 vs. 有效性
7. 总结与展望