StableI2I:识破图像转换中的“瞒天过海”,精准捕捉非预期漂移

StableI2I: Spotting Unintended Changes in Image-to-Image Transition

总结
问题
方法
结果
要点
摘要

本文推出了 StableI2I,一个专门用于评估图像到图像(I2I)转换任务中内容忠实度的统一动态框架。它通过整合语义、结构和底层外观三个维度,能够在无需参考图的情况下,精准捕捉图像编辑或修复过程中产生的非预期变化。

TL;DR

在 Image-to-Image (I2I) 领域,模型往往能生成好看的图,却很难保证“该留的地方一点没变”。StableI2I 是首个从语义级别、结构级别、底层外观三个维度系统评估 I2I 忠实度的框架。它不仅推出了一个极具挑战性的 Benchmark,还通过一种“误差放大”的训练策略,让 8B 规模的模型在检测图像一致性方面击败了包括 GPT-5 和 Gemini-3-pro 在内的顶尖顶配模型。

痛点深挖:消失的栅栏与被重绘的天空

现有的生成模型(如 Flux.1 或 GPT-Image-1)在接收到“把建筑换成树”的指令时,虽然能完美种出一棵树,但往往会顺便把旁边的栅栏删了,或者强行重绘了原本不需要变动的天空。

现有的评估方法面临两大尴尬:

  1. Mask 的局限性:简单的掩码对比无法处理合理的全局变化(如物体改变后的投影变化)。
  2. 大模型的“老花眼”:强如 GPT-4o 或 Gemini,往往能看懂语义,却对像素级的纹理变形和微小的结构位移视而不见。

核心算法:StableI2I 的三维诊疗

StableI2I 将忠实度拆解为三个互补的维度:

  • Semantic Level:是否非预期地添加、删除了语义实体?
  • Structure Level:是否存在像素错位、形状扭曲或纹理重绘?
  • Low-level Appearance:是否引入了噪声、模糊或色偏?

特色的数据流水线:主动制造失败

为了让模型学会识别错误,作者设计了“误差放大”策略:在图像修复任务中,故意给模型喂错误的语义描述(通过 GPT-5 生成),诱导模型产生错误的修复结果。这种“负样本驱动”的思路极大地提升了模型对细节违规的敏感度。

数据构建与标注流程

实验战绩:反杀闭源大模型

在自建的 StableI2I-Bench 上,作者对比了目前市面上最强的视觉大模型。

模型结构准确率语义准确率底层外观准确率平均
GPT-4o46.6%60.8%71.1%59.5%
Gemini-3-pro62.1%63.6%75.5%67.1%
StableI2I (Ours)83.7%67.3%98.0%83.0%

深度洞察: 我们可以看到,StableI2I 在 Low-level (98%)Structure (83.7%) 维度上几乎呈现降维打击。这证明了通过 Texture-Aware Enhancement(纹理感知增强数据)训练,MLLMs 可以获得极强的像素级对齐能力。

模型架构与强化学习流程 上图展示了 StableI2I 如何通过强化学习(GRPO)和 SFT 结合,最终获得诊断级的评估能力。

典型案例分析

StableI2I 的强大之处在于其解释性。当模型判断为“No”时,它能给出逻辑严密的 Think 链条:

  • 场景:将歌手替换为拿气球的人。
  • 诊断:背景从红色的体育馆变成了中性户外场景(判定为语义添加/替换错误)。
  • 底层错误:检测到细微的色偏(Cool color cast)。

定性评估结果展示

总结与局限

StableI2I 填补了 I2I 领域“细粒度忠实度评估”的空白。它证明了即便是在大模型时代,针对特定任务的视觉感官训练依然具有通用模型无法替代的精度。

局限性:在处理“风格迁移”等任务时,模型有时会将合理的风格渲染误判为“重绘(Repainting)”。未来,如何区分“必要的编辑意图”与“非预期的伪影”,仍是该领域值得探索的长远目标。

发现相似论文

试试这些示例

  • 查找最近其他试图解决生成模型图像编辑任务中“内容漂移”或“背景一致性”问题的论文或方法。
  • 哪篇论文最早提出了多模态强化学习中的检查点过滤或自动标注策略,本文的训练流水线与之相比有何改进?
  • 有哪些研究探讨了将这种基于忠实度的评估框架应用到医学影像跨模态转换或卫星遥感图像时序监测任务中?
目录
StableI2I:识破图像转换中的“瞒天过海”,精准捕捉非预期漂移
1. TL;DR
2. 痛点深挖:消失的栅栏与被重绘的天空
3. 核心算法:StableI2I 的三维诊疗
3.1. 特色的数据流水线:主动制造失败
4. 实验战绩:反杀闭源大模型
5. 典型案例分析
6. 总结与局限