[CVPR 2025] Crab+:破解视听场景理解中的“多任务负迁移”魔咒
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
本文提出了 Crab+,一个可扩展且统一视听场景理解模型。通过引入 AV-UIE v2 数据集与全新的 Interaction-aware LoRA (I-LoRA) 架构,在涵盖情感识别、动作识别及跨模态匹配等 7 大任务的 17 个数据集上实现了全能表现,成功解决了多任务训练中的负迁移问题。
TL;DR
在迈向通用视听人工智能(AGI)的道路上,单一模型往往在多任务训练下表现出“顾此失彼”的窘境。中国人民大学与腾讯等团队联合推出的 Crab+,通过 AV-UIE v2 数据集(显式推理过程)和 I-LoRA 动态路由架构,成功扭转了这一局面——在几乎 88% 的任务中实现了正向收益,打造了一个真正能够“听、看、想、写”的视听全能通用模型。
痛点深挖:为什么统一视听模型这么难?
作者观察到一个反直觉的现象:在简单的多任务微调(LoRA Fine-tuning)后,多任务模型的表现往往不如单任务训练(约 56% 的场景出现下降)。这种**负迁移(Negative Transfer)**主要源于:
- 任务粒度差异:像“事件定位”这种低级操作和“对话推理”这种高级语义任务,在数据表征上存在巨大断层。
- 能力需求冲突:空间定位需要像素级的对齐,而情感识别侧重于长程的语义捕捉,共享的静态参数在优化时会产生严重干扰。
核心方案:显式协作(Explicit Cooperation)
1. 数据视角:AV-UIE v2 与显式推理
为了补齐任务间的粒度缺失,Crab+ 构建了 AV-UIE v2。它不只是简单的 (输入, 标签) 对,而是利用 Gemini 1.5 Pro 生成了详细的显式推理链。例如,面对“哪种乐器在响?”的问题,模型会先描述声音频率特征,再结合画面变动得出结论。这种中间表征极大缓解了语义不一致。
2. 模型视角:I-LoRA 与统一接口
Crab+ 设计了一个精妙的 I-LoRA(Interaction-aware LoRA)模块。
- 共享矩阵 A:捕获视听模态底层的通用感知特征。
- 动态路由器 R:Token 级别的软路由,决定当前信息该由哪个“专家头(Head B)”处理。
- 分割模块:集成了 SAM2,通过 MLLM 预测的空间点/框来引导像素级分割,实现了真正的单阶段端到端训练。
图 1: Crab+ 统一架构,包含视觉/音频分支、LLM 骨干及基于 I-LoRA 的交互调整
实验战绩:反转趋势
Crab+ 的表现令人印象深刻。它不仅在 17 个数据集上展现了极强的通用性,更是在多个任务中超越了专用模型:
- 动作/情感识别:在 KS 上达到 91.12% ACC。
- 空间定位:在 Ref-AVS 任务中,相比基线提升了超过 20% 的性能。
- 消融验证:下图展示了 I-LoRA 对正向迁移的巨大贡献,蓝区(性能提升)占据了绝大部分。
图 2: 多任务与单任务学习的协同效应对比,Crab+ 有效解决了负迁移问题
深度洞察:I-LoRA 的头究竟在学什么?
通过可视化,作者发现 I-LoRA 的三个 Head 形成了有趣的分工:
- Head-B1:偏向空间定位与情感识别。
- Head-B2:主攻时间粒度的事件定位。
- Head-B3:擅长处理复杂的问答(AVQA)与跨模态匹配。 这证明了动态权重路由不仅增加了参数容量,更在物理空间上实现了“术业有专攻”。
总结与局限
Crab+ 标志着视听通用模型从“能跑通”进化到了“能共赢”。 局限性:显式推理链对于极简单的任务(如二分类对错)可能引入不必要的过度解读或噪声。未来的方向将是如何自适应地调节推理的颗粒度,并进一步整合音视频生成任务。
关键词:AV-LLM, Crab+, I-LoRA, 多任务学习, 负迁移, 视听理解
