为什么高分测试可能掩盖混乱的表征
多模态表征测试通常会检验模型能否将共享内容(如大脑解剖结构)与模态特有风格(如MRI序列外观)分离开来。但[1]表明,标准训练目标并不能自然实现这一点——即使模型在下游任务上表现良好。他们从理论和实证两方面证明,常见的解耦方法无法分离这些因素,这意味着表征仍然是混杂的。因此,仅关注最终准确率的测试无法告诉你模型是否真正学到了干净、可解释的成分——它可能只是在记忆相关性。
实际后果是:如果你将多模态输入展平为单一向量,并在肿瘤分割等任务上进行测试,可能会得到不错的数据,但这种表示并非真正解耦的。[1]发现,需要添加边际损失来强制跨受试者和模态的关系相似性,才能实现更优的解耦效果。这意味着,如果没有显式约束,“展平”后的表示很可能是一团混杂,而那些不探查内部结构的测试将无法察觉这一点。
假设所有模态均存在的测试可能遗漏灾难性失败
许多多模态测试都在完整数据上进行,但现实世界的输入往往存在模态缺失——比如患者缺少某项化验结果,或音频流中断。[3]表明,当模型仅在完整数据上训练时,一旦某个模态缺失,其性能就会大幅下降,因为固定的融合机制无法应对这种空缺。他们提出了缺失模态想象网络(MMIN),该网络学习从可用模态预测缺失模态的表示,并在模态缺失和完整两种条件下显著提升了情感识别效果。因此,不包含模态缺失场景的测试会高估模型在现实世界中的鲁棒性。
同样地,[2]发现处理缺失模态是临床预测中的一大挑战。他们构建了一个基于Transformer的融合模型,采用模态专属标记和对比学习,即使在排除数据缺失患者的情况下,其性能也优于基线模型。关键见解在于:适用于完整输入的扁平化表示在某一模态缺失时可能无法泛化,而标准测试除非明确模拟缺失情况,否则无法揭示这一问题。
更好的测试真正应该衡量什么
要捕捉这些失败,测试不能只停留在整体准确率上,还需深入探究表征的结构。[1]建议检查表征是否真正实现了模态不变性——例如,测试同一解剖表征能否在不同MRI序列间通用。他们证明,其融合的解剖表征提升了零剂量PET重建和脑肿瘤分割的效果,这表明良好解耦的表征对下游任务更具实用性。因此,一项评估跨模态或跨任务迁移能力的测试,能够揭示扁平化表征是否真正稳健。
另一个角度是在缺失模态的条件下进行测试,正如[2]和[3]所做的那样。[2]使用对比学习来提升表征能力,这对取得更好结果至关重要,而[3]表明,训练模型去想象缺失的模态会有所帮助。一个好的测试应当包含丢弃一种模态的场景,并衡量性能下降的程度。如果模型无法应对这种情况,那么扁平化的表征就不是真正的多模态——它只是简单的拼接,一旦某个输入缺失就会失效。
关于这些来源
本回答基于3项同行评审研究——发表于2021年至2023年间,其中1项发表于Q1–Q2期刊,合计被引228次——这些研究是从3项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的46篇文献。
本文引用的文献
多模态脑MRI分析中的表征解缠
研究表明,针对多模态脑部MRI的常见解耦方法无法自然地将解剖结构与模态信息分离,为此提出了一种结合边际损失与条件卷积的方法,以实现更优的解耦效果,从而提升零剂量PET重建和肿瘤分割等下游任务的性能。
基于注意力的多模态融合与对比学习,可在模态缺失的情况下实现稳健的临床预测
提出了一种基于Transformer的融合模型,采用模态专属标记与对比学习(ARMOUR),在六项涉及结构化与非结构化数据的任务中,即使面对模态缺失的情况,其临床预测性能也优于基线模型。
不确定缺失模态下的情绪识别缺失模态想象网络
提出了一种缺失模态想象网络(MMIN),该网络学习预测缺失模态的表征,在两个基准数据集上显著提升了在不确定缺失模态和完整模态条件下的情感识别性能。
