[CVPR 2025] PureCC:打破“定制化即退化”僵局,让 T2I 模型实现纯净的个性化进化

PureCC: Pure Learning for Text-to-Image Concept Customization

总结
问题
方法
结果
要点
摘要

本文提出了 PureCC,这是一种针对文本生成图像(T2I)的高保真、纯净概念定制方法。该方法通过解耦学习目标,在引入新个性化概念(如特定物体或风格)的同时,有效解决了现有方法中普遍存在的原模型行为破坏及生成能力退化问题,在 SD3.5-M 等流匹配模型上达到了 SOTA 性能。

TL;DR

在 Text-to-Image (T2I) 领域,如果你想让模型学会生成你家那只特定的猫,通常需要牺牲模型原本的“灵性”。现有的微调方法在学会新概念后,往往会丢失对提示词的遵循能力,甚至连背景表现力都会大幅下降。本文提出的 PureCC 方案,通过一种独特的双支路解耦训练架构,实现了在不损伤原模型任何性能的前提下,高保真地“注入”新概念。

痛点深挖:为何定制化模型会变“笨”?

传统的 Concept Customization(如 DreamBooth 或 LoRA)本质上是让模型适应一个新的小样本分布。然而,这种微调过程存在两个致命缺陷:

  1. 行为纠缠 (Behavior Disruption):模型无法区分什么是“你要增加的猫”,什么是“参考图中无关的背景”。导致生成结果中,背景和光影总是被锁定在参考图的样式中。
  2. 能力退化 (Capability Degradation):当模型为了拟合 3-5 张特定图片进行强行优化时,原本在大规模数据上习得的审美和语义理解能力会产生严重的 分布偏移 (Distribution Shift)

问题示意图 上图展示了现有方法在注入新概念后,对原提示词的遵循能力明显变差。

Methodology:PureCC 的秘密武器

PureCC 的核心直觉在于:既然新概念会污染旧知识,那就把它们彻底分开。

1. 自动化的表征提取 (Representation Extractor)

PureCC 首先训练一个临时的表征提取器,通过 Layer-Wise Tunable Concept Embeddings(层级可调概念嵌入)来精准捕捉目标物体的细节。这一步确保了模型能从繁杂的参考图中提取出最纯粹的个性化特征。

2. 双支路纯净学习管道 (Pure Learning Pipeline)

这是 PureCC 的核心架构。在训练阶段,模型分为两个支路:

  • 冻结支路 (Frozen branch):作为“导师”,提供最纯净的目标概念隐式引导。
  • 训练支路 (Trainable branch):接收原模型的条件预测作为基准,只在导师的引导下进行微量、精准的增量更新。

模型架构图

3. 自适应引导缩放

不同的概念复杂度不同,强行使用统一的更新权重会导致过拟合。PureCC 创新性地设计了一个自适应缩放因子 。它通过计算训练支路与冻结引导支路之间的表征对齐度(投影误差),动态决定当前步应该注入多少新知识。

实验与结果:鱼和熊掌兼得

在 SD3.5-M 基座上的实验证明,PureCC 在多项指标上均达到 SOTA。

  • 语义一致性惊人:Seg-Cons 指标反映了生成图像在空间布局上是否背离原模型。PureCC 达到了 69.37,而 DreamBooth 仅为 18.38,说明 PureCC 几乎完美保留了原模型的布局逻辑。
  • 审美不打折:通过 HPSv2.1 指标可见,PureCC 是极少数微调后审美得分几乎没有下降(甚至略有上升)的方法。

实验结果对比

在多概念组合(Multi-concept Customization)场景下,PureCC 展示了极强的解耦能力,能够清晰地生成包含两个不同人物或物体的复杂场景,而不会产生严重的颜色或形状污染。

深度洞察与总结

PureCC 的成功在于它重新审视了个性化微调的本质。它不再是简单的“覆盖”训练,而是一种基于“偏差修正”的补偿式学习。

局限性:虽然精度极高,但由于涉及双支路训练,其显存开销对比 LoRA 等轻量级方法略高。

展望:PureCC 为我们提供了一个新思路——未来的模型定制化或许不再需要对整个权重进行伤筋动骨的修改,通过这种“精细手术式”的引导,我们可以让大模型在保持博学的同时,精准地记住每一个细微的个性化需求。

发现相似论文

试试这些示例

  • 查找最近其他试图解决扩散模型(Diffusion Models)或流匹配模型(Flow Matching)在个性化微调过程中发生灾难性遗忘(Catastrophic Forgetting)的论文。
  • 哪篇论文最早提出了分类器自由引导(Classifier-Free Guidance, CFG)的概念,PureCC 是如何将其优化思想应用到模型训练阶段而非仅仅推理阶段的?
  • 有哪些研究将类似双支路解耦学习的方法应用到了多模态大模型的长文本定制(Long-context Customization)或视频生成定制化任务中?
目录
[CVPR 2025] PureCC:打破“定制化即退化”僵局,让 T2I 模型实现纯净的个性化进化
1. TL;DR
2. 痛点深挖:为何定制化模型会变“笨”?
3. Methodology:PureCC 的秘密武器
3.1. 1. 自动化的表征提取 (Representation Extractor)
3.2. 2. 双支路纯净学习管道 (Pure Learning Pipeline)
3.3. 3. 自适应引导缩放 $\lambda^*$
4. 实验与结果:鱼和熊掌兼得
5. 深度洞察与总结