LoopTrap:当 LLM Agent 陷入“认知死循环”——终止投毒攻击详解
LoopTrap: Termination Poisoning Attacks on LLM Agents
本文提出了 Termination Poisoning(终止投毒),这是一种针对 LLM Agent 的新型攻击,旨在通过注入恶意 Prompt 干扰 Agent 的任务完成判断。作者开发了 LoopTrap 红队框架,能自动分析 Agent 的行为偏好并合成针对性的注入内容,诱导 Agent 进入无限循环。
TL;DR
浙江大学等机构的研究者揭示了 LLM Agent 架构中的一个逻辑漏洞:Termination Poisoning(终止投毒)。通过向 Agent 检索的上下文中注入特定的恶意 Prompt,攻击者可以轻易操纵 Agent 对任务进度的感知,使其在任务早已完成后仍不断进行无效推理。本文提出的 LoopTrap 框架能对不同大模型进行“行为画像”,实现精准的自动化攻击,导致 API 成本暴增数倍。
背景:自主性的代价
现代 LLM Agent(如 AutoGPT, ReAct 架构)的核心是 Thought-Action-Observation 循环。Agent 需要不断自我评估:“我完成了吗?”。这种评估依赖于上下文。
这就产生了一个致命的安全缺陷:如果 Observation 中包含来自网页、文档的恶意指令,且这些指令伪装成系统提示或认证机制,Agent 就会被误导。

核心动机:为什么 Agent 会“停不下来”?
研究者通过认知科学视角,总结了 10 种让 Agent 产生错觉的策略。例如:
- P1 移动终点线(Expanding Horizon):诱导 Agent 认为当前的覆盖率只有 60%,必须达到 100%。
- P4 权威覆盖(Authority Override):伪造系统指令,要求进行“三项额外核查”。
- P7 递归分解(Recursive Decomposition):让 Agent 验证自己的验证过程,陷入无限递归。
关键方法:LoopTrap 的三阶进化
LoopTrap 不是简单的 Prompt 模板,它是一个具备“读心术”的红队 Agent。
1. 行为画像 (Profiling)
每个 LLM 的“脾气”不同。例如,GPT-4o 对“阶段性任务”更敏感,而 Kimi-K2 则更服从“权威指令”。LoopTrap 通过 4 个轻量级探测任务,在大规模攻击前先摸清目标 Agent 的弱点坐标。
2. 自适应陷阱合成 (Trap Synthesis)
基于画像,LoopTrap 使用 UCB1 算法选择最有效的攻击策略,并根据当前任务(如数学推理、信息检索)动态生成 Context-Aware 的攻击载荷。
3. 技能演化 (Skill Evolution)
攻击成功后,LoopTrap 会将该模式抽象为“技能”存入库中;失败后则进行 Self-Reflection,分析 Agent 为什么没有上当,并在下一轮迭代中优化。

实验战绩:代价高昂的循环
研究者在 GAIA 数据集上对 8 种顶级模型进行了实测。结果令人心惊:
- 步骤扩增(SAF):平均增加 3.57 倍的步骤,意味着原本 1 秒完成的任务,现在需要 3.5 秒且 Token 费用翻倍。
- 极端案例:在某些配置下,步骤扩增达到了恐怖的 25 倍。

深度洞察
- 可验证性是天然防线:数学和逻辑类任务因为有客观的标准答案,较难被误导;而开放式的“信息检索”和“科学研究”类任务则是重灾区。
- 指令跟随越强越危险:讽刺的是,遵循指令能力(Instruction Following)越出色的模型(如 GPT-4o-mini),在面对恶意注入时的服从性也越高,反而更容易陷入死循环。
总结与局限
LoopTrap 证明了当前的 Agent 终止机制极度脆弱。未来的 Agent 架构必须引入带外(Out-of-band)监控——即由一个无法接触到不可信 Observation 的独立模块来裁定任务是否真正完成。
虽然本文目前针对的是单 Agent 系统,但在多 Agent 协作场景下,这种“进度污染”可能会像病毒一样在 Agent 群体中传播,导致整个组织的 AI 基础设施瘫痪。
