[ICLR 2025] LATENT-MARK:对抗神经重合成,深藏在潜空间里的音频水印

Latent-Mark: An Audio Watermark Robust to Neural Resynthesis

总结
问题
方法
结果
要点
摘要

本文提出了 LATENT-MARK,这是首个专门针对神经重合成(Neural Resynthesis)攻击而设计的零比特(Zero-bit)音频水印框架。通过在神经编解码器的不变潜空间(Latent Space)中嵌入定向偏移,该方法在保持高感知保真度的同时,实现了对黑盒编解码器攻击的强大鲁棒性。

TL;DR

随着 EnCodec 和 SNAC 等神经音频编解码器的普及,传统的音频水印技术正面临前所未有的生存危机。本文提出的 LATENT-MARK 改变了底层逻辑:不再尝试在容易被抹除的波形表面“涂抹”噪声,而是深入神经网络的潜空间(Latent Space),通过优化波形产生一种编解码器无法丢弃的“语义偏移”。它不仅在神经重合成攻击下表现出色(SOTA),还具备极强的黑盒模型迁移能力。


1. 痛点:为什么神经编解码器是水印克星?

在音频处理的“旧时代”,攻击手段主要是 MP3 压缩、滤波或加噪。传统水印(如 AudioSeal, WavMark)通过心理声学模型隐藏在听觉掩蔽阈值之下,表现得相当稳健。

然而,**神经重合成(Neural Resynthesis)**彻底改变了游戏规则。现代神经编解码器不再是简单的信号删减,而是:

  1. 语义投影:将波形映射到离散的潜记号(Latent Tokens)。
  2. 流形约束:只保留对人类听觉有意义的语义特征,丢弃一切“不在流形上”的残差。

作者发现,即使在肉眼看不出波形变化的重合成后,传统水印信号也会因为相位剧烈偏移和语义重构而彻底消失。

神经重合成导致的水印失效对比 图 (a) 显示水印嵌入后的波形一致性;图 (b) 揭示了 SNAC 处理后波形结构的剧烈变化。


2. 核心机理:潜空间定向偏移 (Latent-Space Shift)

LATENT-MARK 的核心直觉是:如果水印本身就是编解码器试图保护的“语义特征”,它就能活下来。

2.1 潜流形对齐

作者将水印嵌入建模为一个带约束的优化问题。不是简单加噪,而是通过梯度上升,微调输入波形 ,使得编解码器的编码器 输出的潜表示 朝向一个预定义的“秘密向量” 产生偏移。

2.2 秘密轴的选择:Latent-Cluster

选择哪个方向(Axis)进行偏移至关重要。作者对比了三种策略:

  • Random: 随机方向。
  • PCA: 主成分方向。
  • Cluster (本文推荐): 使用 K-means 对 Codebook 聚类,以两个簇中心的连线作为偏移方向。

Why? 实验证明 Cluster 效果最好。因为这个方向指向了潜空间的高密度区域,编解码器在量化阶段会自然地保留这种趋向性,而不是将其视为噪声抹除。

LATENT-MARK 总体架构与机制 图 2 展示了整体管线:通过优化扰动 ,在不改变听感的前提下,诱导潜表示产生检测可见的偏移。


3. 跨编解码器优化:解决黑盒迁移

白盒优化虽然强,但现实中攻击者可能使用完全不同的编解码器。为了实现 Zero-shot Transferability,作者引入了联合交叉编解码器优化 (Joint Cross-Codec Optimization)

  • 同时在 SNAC, DAC, EnCodec 等多个代理模型上进行优化。
  • 平衡梯度:由于不同模型的潜空间尺度不同,引入了校准常数来平衡各自模型的损失贡献。
  • 中位数检测:在检测阶段,使用多模型的 Normalized Margin 的中位数作为最终评分,有效剔除异常干扰。

4. 实验战绩

在 LibriSpeech(语言)、MAESTRO(音乐)、Clotho(环境音)等 8 个数据集上的测试显示:

  • 神经鲁棒性:传统方法(AudioSeal, WavMark)检测率近乎 0%,而 LATENT-MARK 始终保持在 60%-93% 之间。
  • 音质损耗:在 SI-SNR 和感知评价指标 UTMOS 上,LATENT-MARK 与高度保守的 SilentCipher 处于同一梯队,远好于传统加噪方法。

实验结果对比表 表 1 清晰地展示了 LATENT-MARK 在 Survivability (Sur.) 上的压倒性优势。


5. 资深主编点评

LATENT-MARK 的成功在于它精准捕捉到了神经音频处理的**“不变性” (Invariants)**。它不仅解决了当前 AI 音频溯源的紧迫问题,更为未来多模态大模型的版权保护指明了方向:水印不应是信号的补丁,而应是潜空间几何结构的内在属性。

局限性:尽管跨模型迁移表现不错,但对于完全异构或超低比特率的极端压缩,仍存在检测准确率下降的风险。此外,150 步的迭代优化在实时性要求极高的场景下仍有优化空间。

发现相似论文

试试这些示例

  • 查找最近其他针对神经编解码器(Neural Codec)重合成攻击具有鲁棒性的音频水印或指纹技术。
  • 哪篇论文最早探讨了神经编解码器作为“语义过滤器”导致信息丢失的现象,本文如何量化这一过程?
  • 探索将 LATENT-MARK 这种基于潜空间偏移的优化方法应用到视频或跨模态生成模型水印中的可能性。
目录
[ICLR 2025] LATENT-MARK:对抗神经重合成,深藏在潜空间里的音频水印
1. TL;DR
2. 1. 痛点:为什么神经编解码器是水印克星?
3. 2. 核心机理:潜空间定向偏移 (Latent-Space Shift)
3.1. 2.1 潜流形对齐
3.2. 2.2 秘密轴的选择:Latent-Cluster
4. 3. 跨编解码器优化:解决黑盒迁移
5. 4. 实验战绩
6. 5. 资深主编点评