新能力带来了哪些新风险?
既能理解又能生成内容的统一模型比分离系统更强大,但这种力量是一把双刃剑。TokenFlow [1] 和 Janus [2] 均表明,单一模型能以最先进的性能同时处理理解任务(例如回答关于图像的问题)和生成任务(例如根据文本创建新图像)。这意味着攻击者可以利用同一个模型先伪造一张图像,再以支持虚假叙事的方式对其进行解读——而此前这需要两个独立的工具才能完成。由于这些模型被设计为高度灵活(正如 Janus 所指出的),允许每个组件自行选择编码方式,这可能导致安全过滤器被绕过,从而进一步放大风险。
生成逼真图像的能力尤其令人担忧。TokenFlow在384×384分辨率下报告了0.63的强FID分数,这意味着其生成的图像在自动化指标上几乎与真实照片无法区分。结合其理解能力,恶意行为者可以生成一张某人从未做过某事的逼真图像,然后利用模型的理解能力为其添加令人信服的描述,从而制造出难以检测的深度伪造内容。视频领域同样如此:UniVL [4]将这一能力扩展到视频和语言,因此风险也延伸至动态影像以及口头或书面描述。
攻击者如何投毒输入?
由于这些模型从海量的配对数据(图像与文本、视频与音频)中学习,它们容易受到数据投毒攻击。如果攻击者能够将恶意样本注入训练集,他们或许就能让模型在特定情境下表现异常——例如,导致模型对某个物体分类错误,或在特定短语触发时生成有害内容。关于跨模态泛化的论文[5]指出,模型常常假设不同模态之间完美对齐,而这种假设并不现实;这种错位可以被利用。例如,攻击者可以在训练数据中将一张无害图像与一条有害标题配对,教会模型将两者关联起来,从而在之后仅凭该图像就能触发有害输出。
对抗样本是另一类输入侧风险。由于模型处理多种模态,攻击者可能对图像施加微小的扰动,这种扰动对人类不可见,却会导致模型分类错误或生成错误的描述。在Janus [2]和TokenFlow [1]中,视觉编码的解耦意味着理解与生成路径相互独立,但它们共享同一个统一的Transformer,因此对其中一条路径的攻击可能会潜在地影响另一条路径。这是一个全新的攻击面,在理解与生成模型分离的时代并不存在。
需要防范哪些输出端危害?
最明显的输出端危害是大规模生成误导性或有害内容。借助统一模型,你可以生成连贯且与上下文相关的文本、图像,甚至视频(如UniVL [4]所做的那样)。这可能被用来制造附带虚假图像的假新闻文章,或生成某位公众人物从未说过某话的逼真视频。风险不仅在于内容本身,还在于其自动化能力,使得制造虚假信息宣传活动变得成本低廉。
另一个输出端的风险是偏见的放大。这些模型基于包含社会偏见的大型互联网数据集进行训练。如果模型被用于根据文本提示生成图像,它可能会产生刻板印象的表征(例如,总是将护士描绘为女性)。关于视觉-语义嵌入的论文[3]表明,学习到的嵌入空间能够捕捉规律,例如“蓝色汽车的图像”减去“蓝色”加上“红色”后,会接近红色汽车的图像。这种向量运算可能被利用来以非预期的方式操纵模型的输出,例如,通过使用带有偏见的提示生成歧视性内容。关键在于,这些模型不仅仅是检索内容;它们会生成新内容,因此偏见可能以新颖的方式被放大。
关于这些资料来源
本回答基于5项研究(3项经同行评审,2项为预印本),发表于2022年至2025年间,其中2项为2024年或之后发表,合计被引用1562次。这些研究是从5项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的36篇文献。
本文引用的文献
TokenFlow:面向多模态理解与生成的统一图像分词器
TokenFlow引入了一种双码本图像分词器,在理解能力(较LLaVA-1.5 13B提升7.2%)和生成能力(GenEval得分0.55)方面均达到当前最优水平,这表明统一模型可以具备高度能力——因此若被滥用,其危险性也更大。
Janus:解耦视觉编码以实现统一的多模态理解与生成
Janus将视觉编码分离用于理解与生成,表明独立的路径能提升性能和灵活性,但这也意味着攻击可以分别针对每条路径,从而扩大了攻击面。
统一视觉-语义嵌入与多模态神经语言模型
视觉-语义嵌入模型表明,嵌入空间中的向量运算能够捕捉多模态规律,而这些规律可能被利用来以非预期方式操纵输出,例如生成带有偏见或误导性的内容。
UniVL:面向多模态理解与生成的统一视频与语言预训练模型
UniVL将统一建模扩展至视频与语言领域,在五个下游任务上取得了最先进的成果,这意味着其滥用潜力可延伸至视频内容,包括深度伪造视频和自动化虚假信息。
实现跨模态泛化的多模态统一表示
Uni-Code探讨了跨模态泛化问题,表明模型能够从配对数据中学习统一的表征,但同时也指出,假设数据完美对齐是不切实际的——这一弱点可能被攻击者利用,通过制造不对齐的训练数据来实施攻击。
