[CVPR 2025候选] CARE-Edit:通过条件感知专家路由破解多模态图像编辑冲突
CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing
本文提出了 CARE-Edit,一种基于扩散模型(Diffusion Model)的上下文图像编辑框架。该方法通过引入“条件感知专家路由”(Condition-Aware Routing of Experts)机制,利用轻量级潜在注意力路由器将计算动态分配给文本、掩码、参考和基础四个专业专家模块,在多任务图像编辑(如移除、替换、风格迁移)中实现了 SOTA 性能。
TL;DR
传统的图像编辑模型在面对“既要文本描述、又要参考图、还要精确掩码”的复杂需求时,往往会因为各控制信号间的冲突而导致画质崩坏。香港科技大学提出的 CARE-Edit 通过一套类似于“分工合作”的专家路由机制,将不同维度的控制逻辑解耦到专门的专家模块中。它不仅提升了编辑的保真度,还以极少的训练数据击败了参数规模更大的竞品。
背景定位:从“静态融合”到“动态分工”
目前的 SOTA 编辑器(如 ControlNet, OmniControl)大都采用静态融合方案。这意味着无论是在去噪的早期(关注整体构图)还是后期(关注纹理细节),模型处理文本和掩码的策略是一成不变的。这种“一刀切”的做法极易导致 颜色溢出(Color Bleeding) 或 风格漂移(Style Drift)。
CARE-Edit 的核心直觉在于:不同的编辑信号应该由不同的计算路径处理,且这种分配应该是随时间步动态变化的。
痛点深挖:为什么多条件编辑这么难?
- 任务干扰 (Task Interference):文本描述可能与掩码区域冲突,导致物体长出界。
- 空间不精确:用户画的 Mask 通常很粗糙,静态适配器很难自动修复边界。
- 静态容量限制:单一路径的骨干网络很难同时完美兼顾“保持原图背景”和“完全改变物体风格”。
核心架构详解 (Methodology)
CARE-Edit 引入了三个关键模块来应对上述挑战:
1. 异构专家路由 (Routing of Experts)
模型在 DiT (Diffusion Transformer) 中嵌入了四个专家:
- Text Expert: 专注语义推理。
- Mask Expert: 专注空间精度。
- Reference Expert: 负责身份和风格迁移。
- Base Expert: 类似“底座”,负责全局一致性。

2. Mask Repaint:动态掩码修复
传统方法中 Mask 是死的,但 CARE-Edit 会在去噪过程中,利用当前生成的潜在特征和参考特征,不断迭代预测一个更精准的软掩码(Soft Mask)。这解决了用户随手涂鸦导致的边缘生硬问题。
3. Latent Mixture:精细化融合
这是最后的汇聚步骤。它通过一个 Channel-wise 的门控机制,根据路由器的信心分,将各个专家的输出线性组合,确保前景编辑与背景底图完美“缝合”。
实验与结果分析
SOTA 性能对比
在针对主观意图和身份保持的 DreamBench++ 测试中,CARE-Edit 表现优异。即使面对多目标(Multiple-Object)这种地狱难度的编辑任务,其 DINO-I 分数依然位列榜首。

专家究竟在干什么?
作者通过实证分析发现了一个有趣的规律:
- Base Expert 在整个去噪过程中始终保持高激活,充当“定海神针”。
- Mask Expert 主要在物体移除任务中发力。
- Reference Expert 在风格迁移时被高度激活。 这种通过可视化 Attention Map 得到的规律,完美验证了“分工处理”的有效性。

深度洞察与总结
CARE-Edit 的价值在于它提供了一种低成本扩充模型能力的新思路。 它不需要重新训练巨大的基础模型,而是通过 LoRA 结合 MoE 路由,以增量式的方式让模型学会“看碟下菜”。
局限性: 目前的专家集合是预定义的(Text, Mask, Ref, Base)。如果未来出现更复杂的控制条件(如 3D 深度图、姿态骨架),如何更优雅地自动扩展专家池(Dynamic Expert Expansion)将是下一个值得研究的技术点。
Takeaway: 如果你也受困于多模态扩散模型的“信号掐架”,那么 CARE-Edit 的异构专家分工思路绝对是目前的标准答案。
