多层红队测试究竟做到了哪些其他方法做不到的事?
多层红队测试将AI智能体视为一组攻击面的堆叠——基础设施、协议/工具、智能体行为以及模型本身——并针对每一层使用定制攻击进行探测。这与检索、微调或人工审查有本质区别,后者属于防御性或评估性手段,而非对抗性手段。其关键优势在于,它能发现仅在智能体于完整环境中行动时才会出现的故障。2025年的一项研究对比了对独立模型进行红队测试与对同一模型置于智能体循环中的测试,结果发现了“仅智能体存在的漏洞”——即只有在模型使用工具时才会生效的攻击,其中工具调用场景的漏洞率比非工具场景高出24%[5]。这意味着,如果你只对模型进行孤立测试,就会错过一整类现实世界中的故障。
多层方法还扩展了攻击发现的规模。2025年提出的框架CoRT(可控风险隐藏红队测试)利用多轮对话隐藏恶意意图,在金融领域的九个大型语言模型上实现了95%的平均攻击成功率[1]。另一个智能体红队测试框架CoP(原则组合)通过将人类提供的原则编排成新颖的越狱提示,将已知最佳的单轮攻击成功率提升了多达19倍[2]。这些数据表明,红队测试不仅仅是发现已知问题——更在于发掘其他方法无法预见的全新攻击向量。
检索、微调与人工审查作为替代方案,如何比较?
检索与微调属于加固技术:它们通过提供更好的上下文或调整权重,使智能体更不容易产生有害输出。它们有助于降低已知风险,但无法告诉你剩余风险是什么。例如,2026年的一份协调模式目录指出,检索层防御可以通过“盆地加固循环”来改进——这是一种迭代强化检索层直至达到特定深度比的技术[4]。那是一个防御性循环,而非发现机制。类似地,微调可以嵌入安全规则,但红队测试才能揭示这些规则在对抗压力下是否依然成立。
人工评审是判断的金标准,但难以规模化。一篇2026年关于“人在桥上”(HOB)的论文指出,人在回路中的评审虽能保留专家判断,却“不易扩展”[3]。相反,HOB将专家知识前置编码——包括领域背景、红队陷阱、评分指南——然后通过自动化测试框架反复运行。在一项涵盖金融、医疗和代码生成领域23,500个智能体交互回合的研究中,这种方法发现了静态基准和单一评估者评分所遗漏的失败,例如虚假工具调用声明和政策漂移[3]。因此,人工评审最适合用于构建可复用的评估智能,而非逐条手动检查每一次交互。
每种方法分别应在何时使用?它们能否协同工作?
证据表明,这些方法是互补的,而非互斥的。多层红队测试是发现引擎——它找出新的漏洞。检索与微调是补丁层——它们修复已知问题。人工审查是质量关卡——它确保修复正确且评估有意义。2026年的框架AI-Infra-Guard明确将一种检测范式对应到每一层:基础设施采用确定性规则匹配,MCP服务器和智能体技能采用LLM驱动的审计,智能体行为采用多轮黑盒红队测试,模型本身则采用越狱测试框架[6]。在所有这些论文中,这种分层方法是唯一覆盖所有攻击面的方案,包括对智能体技能的供应链审计。
实际要点是:如果你正在构建或部署AI智能体,应从多层红队测试入手,摸清攻击面,然后利用检索和微调来填补发现的漏洞,并通过人工审查来验证修复效果,同时筛选出可复用的测试用例。HOB研究表明,当专家判断被预先编码时,较小的评估模型也能挑战前沿智能体[3],这意味着你不需要庞大的团队来维持质量——你需要的是一套聪明的红队设置和良好的筛选流程。
关于这些来源
此回答基于6项研究(均为预印本)——发表于2025年至2026年,其中6项为2024年或之后——这些研究是从7项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的72篇文献。
本文引用的文献
学习隐藏风险:面向金融领域大语言模型的可控多轮红队测试
CoRT,一种可控的多轮红队测试框架,在金融领域对九个大语言模型实现了95%的平均攻击成功率,其采用的风险隐藏提示看似合法,却能诱导模型产生监管违规行为。
CoP:利用原则组合对大型语言模型进行智能体红队测试
CoP,一个基于人类提供原则组合的智能体红队框架,将针对领先大语言模型的已知最佳单轮攻击成功率提升了最多19倍。
人桥:AI代理的可扩展评估
Human-on-the-Bridge(HOB)将专家判断预先编码,并在23,500次智能体交互中反复复用,从而发现了静态基准测试和单一评估者评分所遗漏的失败情况,包括虚假工具调用声明和政策漂移。
Logotic技术目录:从对抗性AI智能体架构中恢复合作性与防御性协调模式
逻辑技术目录将对抗性协调模式重新分类以供防御性使用,其中包括一种用于检索层防御的“盆地加固循环”,这表明技术具有底物中立性,能够服务于多种范式。
关注差距:在GPT-OSS-20B上通过动作图可观测性比较模型级与智能体级红队测试
对GPT-OSS-20B的对比性红队分析发现,仅在使用工具的情境中才会出现的智能体专属漏洞,其中工具调用情境的漏洞率比非工具情境高出24%。
确保AI智能体安全:面向多层智能体红队测试的统一框架
AI-Infra-Guard是一个开源框架,将检测范式与四个层级(基础设施、协议/工具、智能体行为、模型)相匹配,覆盖75+个AI组件和1,400+条漏洞规则,并配备包含26+种攻击操作符的越狱测试工具集。
