EMOE:拒绝“一刀切”融合,让每个模态专家各司其职

EMOE: Modality-Specific Enhanced Dynamic Emotion Experts

2025-06-10
Yiyang Fang, Wenke Huang, Guancheng Wan, Kehua Su, Mang Ye
总结
问题
方法
结果
要点
摘要

本文提出了 EMOE(Modality-Specific Enhanced Dynamic Emotion Experts),一种针对多模态情感识别(MER)的新型框架。该方法通过 Mixture of Modality Experts 实现样本级的动态权重分配,并结合 Unimodal Distillation 技术,在 CMU-MOSI 和 CMU-MOSEI 等主流数据集上刷新了 SOTA 性能。

TL;DR

在多模态情感识别(MER)中,文本、视觉和音频的重要性并非固定。本文提出的 EMOE 框架通过动态的“专家路由”机制,为每一个输入样本量身定制模态权重,并巧妙利用单模态蒸馏技术挽救了被融合过程掩盖的特异性特征。实验证明,该方法在情感识别与意图识别任务中均显著优于现有的 SOTA 方法。

背景:被忽视的“个体差异”与“单模态天赋”

在处理一段视频情感时,有时个体的表情泄露了天机,有时则是语调文本语义更具辨识度。然而,主流的融合方法(如简单的拼接或 Tensor Fusion)往往对所有样本采用统一的融合逻辑。这种“一刀切”的做法导致了两个严重后果:

  1. 模态平衡困境:模型容易过度依赖某种强势模态(如文本),而忽略了在特定样本中更有价值的辅助模态。
  2. 模态特异性消失:在追求跨模态共性特征时,单模态独特的预测本领(Specialization)往往在融合层被洗掉了。

核心方法演练:动态路由与知识回流

1. 模态专家混合 (MoME)

EMOE 将每个模态(语、视、音)视为一个独立的 Expert。其核心由一个 Router 网络 驱动,它根据输入特征实时计算权重分布

  • 专家平衡机制:为了防止模型在训练早期陷入对某一模态的“路径依赖”,作者引入了 Router Entropy Loss。这迫使 Router 保持一定的探索性,确保所有模态都能得到充分的一致性训练。

模型架构图 图 1:EMOE 整体架构,展示了从路由权重分配到特征融合的全过程。

2. 带 Router 选择的单模态蒸馏 (UD)

这是本文的另一大看点。为了不让单模态的预测能力在融合中流失,作者设置了专门的单模态分类头,并执行单向知识蒸馏:让融合后的“综合特征”去学习“加权后的单模态特征”。

  • 核心直觉:通过让单模态作为老师来指导多模态特征,模型在保留宏观视野的同时,能捕捉到微观的模态细节。

实验战果:刷榜 MER 与 MIR

EMOE 在 CMU-MOSICMU-MOSEI 等基准数据集上进行了严谨测试。结果显示,在最具挑战性的 ACC-7(七分类准确率)上,提升尤为显著。

实验结果对比 表 1:在 CMU-MOSI 数据集上的表现,EMOE 在多项指标上超越了之前的 DMD 和 Self-MM。

此外,通过 t-SNE 可视化(见图 5),我们可以清晰地看到,EMOE 生成的特征空间分布具有极强的连续性和区分度,完美契合情感强度的回归任务需求。

特征可视化对比 图 2:t-SNE 降维显示,引入 MoME 和 UD 后,特征分布更加紧凑且符合情感梯度。

深度洞察

EMOE 的成功在于其对 Inductive Bias 的精准捕捉:即多模态任务本质上是异构且动态的。它通过 Router 解决了“谁更重要”的问题,通过 UD 解决了“固有本领不能丢”的问题。

局限性分析:尽管动态路由提升了性能,但在超大规模实时推理场景下,Router 本身带来的计算开销以及对温度参数 的敏感性仍是实际应用时需要精细调优的环节。

总结

EMOE 并非通过堆砌模型复杂度来取胜,而是通过深入剖析多模态学习中的退化行为,用简洁的动态加权与蒸馏机制找回了消失的模态特异性。这为未来构建更具鲁棒性的 Affective Computing 系统提供了极具价值的参考。

发现相似论文

试试这些示例

  • 查找最近一年内利用 Mixture of Experts (MoE) 架构解决多模态学习中模态不平衡问题的相关进展。
  • 哪篇论文最早探讨了多模态融合中“模态竞争”导致弱势模态训练不足的现象,本文与之相比有何改进?
  • 调研将单模态知识蒸馏 (Unimodal Distillation) 应用于多模态视频分析(如动作识别或音视频同步)的最新研究。
目录
EMOE:拒绝“一刀切”融合,让每个模态专家各司其职
1. TL;DR
2. 背景:被忽视的“个体差异”与“单模态天赋”
3. 核心方法演练:动态路由与知识回流
3.1. 1. 模态专家混合 (MoME)
3.2. 2. 带 Router 选择的单模态蒸馏 (UD)
4. 实验战果:刷榜 MER 与 MIR
5. 深度洞察
6. 总结