[arXiv 2025] 撬开 LLM 的“铁幕”:利用受审模型研究隐匿知识提取
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
本文提出了利用受审查的中国开源大语言模型(如 Qwen3, DeepSeek-R1)作为自然实验场,研究“隐匿知识提取”(Secret Knowledge Elicitation)和“谎言检测”(Lie Detection)技术。研究表明,这些模型虽然在政治敏感话题上受过审查训练,但其内部仍保留着真实的知识,可以通过特定手段提取。
TL;DR
如果一个 AI 模型被明确要求在敏感问题上“撒谎”或“保持沉默”,它是否还记得真相?本文通过对 Qwen3、DeepSeek-R1 等中国大语言模型进行深度审计,发现这些由于政治审查而表现出“不诚实”的模型,实际上是研究 隐匿知识提取 (Secret Knowledge Elicitation) 的完美天然实验场。通过简单的 Next-token 采样 和 Few-shot Prompting,我们可以轻易地绕过审查防线,让模型“吐露真言”。
1. 为什么我们需要“受审模型”作为实验场?
在 AI 安全领域,研究者通常通过人工注入“后门”或通过监督微调让模型学会撒谎,以此来测试诚实性检测工具。但这种方法存在 Artificial Bias:人工构建的撒谎逻辑可能过于简单或具有特定的激活特征,与现实世界中复杂的对齐训练不符。
受审的中国模型(如 Qwen, DeepSeek)提供了一个绝佳的观察窗口:
- 知识共存:模型既接受了海量真实互联网数据的预训练,又接受了严格的合规性对齐训练。
- 自然矛盾:模型在回答同一问题时,由于 Prompt 细微差异,有时会触发拒绝逻辑,有时却能流利地输出真相(如下图 2 所示)。这种不一致性正是我们研究“模型明知故犯”的切入点。
图 2:Qwen3 在被问及敏感话题时,基准回答(左)选择撒谎,但在特定干预下(右)给出了符合事实的详尽回答。
2. 挖掘技术:如何让模型说实话?
作者测试了多种“撬动”诚实性的方法,发现最有效的并不是复杂的数学干预,而是打破模型的 Persona(人格):
2.1 Next-token 采样:打破对话框架
传统的 Chat 模式会强制模型进入“AI 助手”角色。通过直接进行 Next-token Completion(例如预填 Unbiased AI:),模型会认为它正在续写一段客观文档,从而极大地降低了触发审查模式的概率。
2.2 Prefill 攻击 (预填前缀)
这是近年来非常硬核的方法。通过直接在推理阶段给模型喂入一个自信的开头(例如:The answer to this question is...),模型会产生 Instruction Following 的惯性,为了保持逻辑连贯性,它被迫跳出拒绝回答的预设模板。
2.3 基于通用 honesty 数据集的微调
令人惊讶的是,即使在与政治话题完全无关的诚实数据(如 Alpaca 或专门的诚实披露数据)上进行微调,也能显著增强模型在受审话题上的诚实度。这暗示了 诚实性 (Honesty) 在模型内部可能是一种全局性的特征,而非针对特定话题的补丁。
图 4:各项提取技术在 Chat 场景下的表现对比,Few-shot 和 Next-token 表现最为亮眼。
3. 谎言检测:模型知道自己在撒谎吗?
研究的另一半重点是 Lie Detection。如果模型正在输出虚假信息,它的“内心”是否会有所起伏?
- 模型自评 (Self-classification):直接问模型:“你刚才的回答是否包含了由于政策原因而产生的虚假信息?” 实验发现,这种简单的提问在 Qwen3 等模型上的准确率奇高。这说明 模型在生成谎言的同时,完全意识到自己在违背事实。
- 激活探测 (Activation Probing):通过在模型的中间层(如 Qwen3-32B 的第 47 层)训练一个线性分类器,可以仅凭隐藏层状态就判断模型是否在撒谎。这证明诚实性是一种 Linear Feature,被编码在模型的 Latent Space 中。
4. 跨机型验证:从 32B 到 397B
作者将这些方法应用到了目前的顶尖模型上,包括 DeepSeek-R1 和 Qwen3.5-397B。结果表明,规模效应并没能更好地“隐藏”真相,反而因为模型能力的增强,一旦审查防线被撕开,它产出的真实信息比小模型更详尽、更准确。
图 6:即便在最先进的 Open-weights 模型上,这些提取手段依然能将 Honesty Score 从 20% 水平大幅拉升至 70% 以上。
5. 深度洞察与思考
本论文揭示了一个深刻的现实:审查和对齐并不是删除知识,而是在输出侧放置了一道闸门。
- 脆弱的屏障:现有的对齐技术(如 RLHF/DPO)在面对改变对话范式(Next-token)或上下文惯性(Few-shot)的黑盒攻击时显得不堪一击。
- 诚实的本质:模型似乎存在一种“元认知”,它能清晰地分辨哪些是它“被迫说的”,哪些是它“原本知道的”。对于安全审计员来说,这意味着探测模型是否存在隐藏偏见或秘密指令变得更有可能。
局限性:虽然这些方法能大幅提高诚实度,但没有一种技术能 100% 消除虚假回答,尤其是在模型本身由于预训练数据污染导致认知模糊的领域。
总结
这篇工作为我们提供了一个全新的视角:不要试图构建谎言,而是去寻找那些正在被逼说谎的高级 AI。在这个过程中,我们不仅学会了如何打破审查,更重要的是,我们开始理解大型模型复杂对齐背后,那颗始终“诚实”的内心。
