[CVPR 2025] Crab+:破解视听场景理解中的“多任务负迁移”魔咒

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

总结
问题
方法
结果
要点
摘要

本文提出了 Crab+,一个可扩展且统一视听场景理解模型。通过引入 AV-UIE v2 数据集与全新的 Interaction-aware LoRA (I-LoRA) 架构,在涵盖情感识别、动作识别及跨模态匹配等 7 大任务的 17 个数据集上实现了全能表现,成功解决了多任务训练中的负迁移问题。

TL;DR

在迈向通用视听人工智能(AGI)的道路上,单一模型往往在多任务训练下表现出“顾此失彼”的窘境。中国人民大学与腾讯等团队联合推出的 Crab+,通过 AV-UIE v2 数据集(显式推理过程)和 I-LoRA 动态路由架构,成功扭转了这一局面——在几乎 88% 的任务中实现了正向收益,打造了一个真正能够“听、看、想、写”的视听全能通用模型。

痛点深挖:为什么统一视听模型这么难?

作者观察到一个反直觉的现象:在简单的多任务微调(LoRA Fine-tuning)后,多任务模型的表现往往不如单任务训练(约 56% 的场景出现下降)。这种**负迁移(Negative Transfer)**主要源于:

  1. 任务粒度差异:像“事件定位”这种低级操作和“对话推理”这种高级语义任务,在数据表征上存在巨大断层。
  2. 能力需求冲突:空间定位需要像素级的对齐,而情感识别侧重于长程的语义捕捉,共享的静态参数在优化时会产生严重干扰。

核心方案:显式协作(Explicit Cooperation)

1. 数据视角:AV-UIE v2 与显式推理

为了补齐任务间的粒度缺失,Crab+ 构建了 AV-UIE v2。它不只是简单的 (输入, 标签) 对,而是利用 Gemini 1.5 Pro 生成了详细的显式推理链。例如,面对“哪种乐器在响?”的问题,模型会先描述声音频率特征,再结合画面变动得出结论。这种中间表征极大缓解了语义不一致。

2. 模型视角:I-LoRA 与统一接口

Crab+ 设计了一个精妙的 I-LoRA(Interaction-aware LoRA)模块。

  • 共享矩阵 A:捕获视听模态底层的通用感知特征。
  • 动态路由器 R:Token 级别的软路由,决定当前信息该由哪个“专家头(Head B)”处理。
  • 分割模块:集成了 SAM2,通过 MLLM 预测的空间点/框来引导像素级分割,实现了真正的单阶段端到端训练。

模型架构图 图 1: Crab+ 统一架构,包含视觉/音频分支、LLM 骨干及基于 I-LoRA 的交互调整

实验战绩:反转趋势

Crab+ 的表现令人印象深刻。它不仅在 17 个数据集上展现了极强的通用性,更是在多个任务中超越了专用模型:

  • 动作/情感识别:在 KS 上达到 91.12% ACC。
  • 空间定位:在 Ref-AVS 任务中,相比基线提升了超过 20% 的性能。
  • 消融验证:下图展示了 I-LoRA 对正向迁移的巨大贡献,蓝区(性能提升)占据了绝大部分。

实验结果对比 图 2: 多任务与单任务学习的协同效应对比,Crab+ 有效解决了负迁移问题

深度洞察:I-LoRA 的头究竟在学什么?

通过可视化,作者发现 I-LoRA 的三个 Head 形成了有趣的分工:

  • Head-B1:偏向空间定位与情感识别。
  • Head-B2:主攻时间粒度的事件定位。
  • Head-B3:擅长处理复杂的问答(AVQA)与跨模态匹配。 这证明了动态权重路由不仅增加了参数容量,更在物理空间上实现了“术业有专攻”。

总结与局限

Crab+ 标志着视听通用模型从“能跑通”进化到了“能共赢”。 局限性:显式推理链对于极简单的任务(如二分类对错)可能引入不必要的过度解读或噪声。未来的方向将是如何自适应地调节推理的颗粒度,并进一步整合音视频生成任务。


关键词:AV-LLM, Crab+, I-LoRA, 多任务学习, 负迁移, 视听理解

发现相似论文

试试这些示例

  • 查找最近一年内其他试图解决多模态大模型多任务训练中负迁移(Negative Transfer)问题的论文。
  • 哪篇论文最早在 LoRA 中引入了 Mixture-of-Experts (MoE) 或动态路由机制,本文与之相比在视听任务上有何改进?
  • 目前有哪些研究致力于将 Crab+ 这种基于显式推理(Explicit Reasoning)的数据构造方法应用到视听生成(Generative tasks)任务中?
目录
[CVPR 2025] Crab+:破解视听场景理解中的“多任务负迁移”魔咒
1. TL;DR
2. 痛点深挖:为什么统一视听模型这么难?
3. 核心方案:显式协作(Explicit Cooperation)
3.1. 1. 数据视角:AV-UIE v2 与显式推理
3.2. 2. 模型视角:I-LoRA 与统一接口
4. 实验战绩:反转趋势
5. 深度洞察:I-LoRA 的头究竟在学什么?
6. 总结与局限