模糊即漏洞:视觉降级如何诱发 MLLM 的“认知过载”并导致安全崩溃

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

总结
问题
方法
结果
要点
摘要

本文揭示了多模态大语言模型(MLLM)的一个严重安全漏洞:视觉降级(如降低分辨率、加噪或模糊)会显著提高越狱攻击(Jailbreak)的成功率。作者提出了“认知过载”(Cognitive Overload)假设,并通过“结构化认知卸载”防御策略在 Qwen3-VL 等 SOTA 模型上将攻击成功率(ASR)从 67.4% 降低至 4%。

TL;DR

传统的 AI 安全观认为,模型看不清就干不了坏事。但西湖大学等机构的最新研究《Hard to Read, Easy to Jailbreak》打破了这一直觉:当文字变得模糊但尚可辨认时(Attack Comfort Zone),MLLM 的安全防线会发生突然坍塌。研究提出的**认知过载(Cognitive Overload)**假说认为,模型忙于“辨认”文字而忽略了“审核”内容。

1. 危险的“攻击舒适区” (ACZ)

随着模型处理长文本的需求增加,一种新兴技术——视觉上下文压缩(将成千上万个 token 渲染成一张长图)被广泛应用。为了省资源,这些图像往往分辨率不高。

作者发现,当图像分辨率(DPI)处于 45 到 150 之间时,会出现一个诡异的现象:模型能够准确地进行 OCR(识别率 > 80%),但其原本严密的安全对齐(Safety Alignment)却消失了。在这个区间内,模型像是一个因为看课本太费劲而失去辨别是非能力的学生,乖乖听从了图中隐藏的有害指令。

攻击舒适区现象图 图 1:随着 DPI 降低,OCR 准确率(蓝色)缓慢下降,但 ASR 攻击成功率(红色)在中间区域出现激增,形成倒 U 型曲线。

2. 核心直觉:认知过载与安全延迟

为什么会出现这种现象?作者提出了认知过载假设

  • 计算资源争夺:在模型的 Transformer 浅层中,有限的计算能力被优先分配给了“视觉降噪”和“字符识别”。
  • 特征涌现延迟 (Feature Latency):研究人员通过向模型各层插入“安全探针”后发现,对于清晰图像,有害特征在浅层就会被识别并触发拒绝逻辑;而对于模糊图像,有害语义的识别被推迟到了深层,此时已错过了安全防护的最佳时机(Shallow Safety Guardrails)。

安全探针分析 图 2:层级探测显示,ACZ 输入(橘色)在浅层的表征与安全样本(绿色)极度接近,成功逃避了早期检测。

3. 把“感知”与“审计”拆开:结构化认知卸载

既然问题的根源在于“一心二用”,那么解决方案就是强制串行化

作者提出了 Structured Cognitive Offloading 防御策略。不再直接问模型“图中问题怎么答”,而是要求其严格遵循三个步骤:

  1. Transcription (转录):先把图里的字逐字抄下来。
  2. Safety Evaluation (评估):判断抄下来的这段话有没有毒。
  3. Response (回复):如果没毒再回答。

这种方法将沉重的视觉解码负担在第一步“卸载”掉,让第二步的安全性审计发生在模型最擅长、最稳健的文本领域(Text Modality)。

防御策略对比 图 3:左侧展示了多种干扰(模糊、噪声、扭曲)如何引发攻击,右侧展示了串行化协议如何化解危机。

4. 实验战绩与深度洞察

该方法在 Qwen3-VL、GPT-4.1、Claude-4.5 等一众顶尖模型上进行了验证。有趣的结果包括:

  • 跨语种有效:这种漏洞在中文有害指令上也同样存在,证明它是 MLLM 架构的底层通病。
  • 无损性能:防御策略并不会导致模型变得“玻璃心”(过度拒绝),在 300 个良性测试样本中,误报为 0,且因为先做了 OCR,其最终回答的质量反而提升了。
  • 并非资源不足:作者通过补白(Padding)实验证明,即使给模糊图像分配和高清图一样多的 token 数量,只要图像内容是模糊的,漏洞依然存在。

5. 总结与启示

这篇论文极具启发性地指出:安全对齐不是 static(静态)的,而是与计算资源的动态分配息息相关

  • 开发者警示:如果你的产品涉及 OCR 预处理或视觉长文本压缩,绝对不能直接将压缩后的图像丢给 LLM 生成回复。
  • 局限性:虽然这一防御策略极为有效,但它会让模型的输出长度翻倍(因为要先吐一遍 OCR 结果),这对于实时性要求极高的场景存在挑战。

未来的研究需要探索如何在不增加推理延迟的前提下,在模型架构层面实现这种“感知-审计”的鲁棒解耦。

发现相似论文

试试这些示例

  • 查找最近其他关于利用多模态模型内部计算资源竞争或“特征延迟出现”来实现攻击的论文。
  • 哪篇论文最早探讨了文本渲染图像(Visual-Text Compression)在长上下文处理中的效率与安全性权衡?
  • 有哪些研究在探讨 MLLM 浅层与深层在处理安全过滤与语义理解时的分工差异?
目录
模糊即漏洞:视觉降级如何诱发 MLLM 的“认知过载”并导致安全崩溃
1. TL;DR
2. 1. 危险的“攻击舒适区” (ACZ)
3. 2. 核心直觉:认知过载与安全延迟
4. 3. 把“感知”与“审计”拆开:结构化认知卸载
5. 4. 实验战绩与深度洞察
6. 5. 总结与启示