DualSentinel:捕捉大模型受攻击时的“呼吸频率”
DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern
本文提出了 DualSentinel,一种针对黑盒大语言模型(LLM)的可靶向攻击(如后门和提示词注入)的轻量化防御框架。该方法基于作者新发现的“熵值平滞(Entropy Lull)”现象,结合实时监控与任务翻转验证,实现了极高的检测准确率和接近零的误报。
TL;DR
近日,来自香港科技大学和浙江大学的研究团队提出了一款名为 DualSentinel 的轻量级防御框架。他们发现当 LLM 遭受后门攻击或提示词注入(Prompt Injection)被强行要求输出特定内容时,模型的输出会进入一种极为死板、毫无“创造性”的低熵状态,即 Entropy Lull(熵值平滞)。利用这一直觉,DualSentinel 在不影响正常推理速度的前提下,能近乎完美地拦截黑盒 API 场景下的各类靶向攻击。
1. 研究动机:防御者的“黑盒”困境
目前保护大模型免受攻击的方法面临三个痛点:
- 权限门槛高:很多方法需要访问模型内部权重(White-box),但这在调用 ChatGPT、Qwen 等 API 时是不可能的。
- 计算成本贵:现有的检测手段往往需要重复运行多次推理,延迟巨大。
- “杀敌一千,自损八百”:对输入进行过度清洗常会导致模型对正常指令的理解力下降。
研究团队认为,无论是后门触发还是指令注入,本质都是剥夺了模型的“自由意志”,迫使它走上一条预设好的、确定性的输出路径。
2. 核心直觉:什么是 Entropy Lull?
在正常的对话中,LLM 在生成下一个 Token 时通常会有多个合理的候选词,此时概率分布的 Shannon Entropy(香农熵) 较高且波动明显,这代表了模型的“创造力”。
然而,一旦攻击激活,LLM 就像是在背诵一段死代码:
- 低数值 magnitude:概率高度集中在攻击者预设的 Token 上。
- 高稳定性 stability:在整个恶意序列生成过程中,这种极低的熵值会持续维持,形成一个明显的“平滞期”。
上图清楚地展示了:正常生成时熵值剧烈波动(左),而遭受攻击时熵值迅速跌入谷底并保持平稳(右)。
3. DualSentinel 架构:两步动态审计
DualSentinel 采用了“实时监控 + 二次校验”的双重机制:
第一步:实时监控 (Monitoring)
在 LLM 生成 Token 的同时,系统会计算最近几个步长的平均熵值和标准差。如果满足以下两个条件,则发出警戒:
- 低量级条件:平均值低于经验阈值 (如 1e-2)。
- 稳定趋势条件:当前步生成的熵值波动在上一时刻的标准差范围内。
第二步:任务翻转验证 (Task-Flipping Verification)
为了排除模型在输出成语、事实性短语(如 URL)时产生的良性低熵干扰,DualSentinel 会引入任务翻转。
- 动作:在原始 Prompt 前加上“请用创新的方式重述以下指令”这一前缀。
- 逻辑:如果是正常内容,模型会遵循新指令改变输出路径(熵值消失或改变);如果是恶意劫持,由于后门触发器或注入指令的存在,模型会表现出“认知僵化”,强行无视重述指令继续输出低熵的攻击目标。

4. 实验表现:SOTA 级的攻防博弈
研究团队在 Llama-2 和 Qwen 多个尺寸的模型上进行了验证,涵盖了字级、词级后门以及各种复杂的提示词注入手段。
核心战绩:
- 准确率:在 Alpaca 和 XSum 任务上,DualSentinel 的 TPR(检测成功率)接近 100%,显著超过了传统的基于 PPL(困惑度)或输入扰动的基线方法(如 STRIP, ONION)。
- 零误报:相比 ConfGuard 等容易误伤事实性问题的工具,DualSentinel 通过任务翻转将 FPR(误报率)降低了数倍。
- 极速响应:对于良性输入,几乎不增加延迟(ATGR ≈ 1);对于恶意攻击,因为能实现“提前截断”,平均生成时间甚至比不防御还要短!

5. 总结与启示
DualSentinel 的成功提示我们:受控的模型是不自由的,而不自由的模型是有迹可循的。
- 价值点:它不需要重新训练模型,也不依赖特定的攻击模式(Attack-agnostic),非常适合作为 API 网关的中间件。
- 局限性:如果攻击者能通过某种混淆技术(如在攻击序列中加入随机噪声)来人为拉高熵值,可能会对这一机制构成挑战。
在 LLM 赋能千行百业的当下,这种丝滑、低成本且无感的“安全监控器”正是开发者最需要的防弹衣。
