开源图像编辑模型:隐藏的 Zero-shot 视觉专家

Open-Source Image Editing Models Are Zero-Shot Vision Learners

总结
问题
方法
结果
要点
摘要

本文系统评估了 Qwen-Image-Edit, FireRed-Image-Edit 和 LongCat-Image-Edit 等开源图像编辑模型在 Zero-shot 视觉任务中的表现。研究发现,这些模型无需任何微调即可执行单目深度估计、表面法线估计和语义分割,且在某些指标上超越了经过特定任务训练的 SOTA 模型(如 FireRed 在表面法线估计上超过了 Marigold)。

TL;DR

腾讯的研究团队发现,像 Qwen-Image-Edit 这样的大型开源图像编辑模型,在没有经历过任何特定视觉任务(如深度估计、法线预测)训练的情况下,展现出了惊人的 Zero-shot 视觉理解能力。通过简单的文本指令引导,这些模型不仅能理解物体边界,还能推断出精准的 3D 空间几何关系,其表现甚至在某些指标上超越了专门微调过的 SOTA 模型。

背景定位:不只是“修图师”,更是“视觉学习者”

在 AI 领域,目前的共识是大型生成模型拥有极强的理解力。然而,这一证据大多来自 Veo 3 等闭源模型。本文填补了开源领域的空白,揭示了一个深刻的 Insight:为了实现高质量的图像编辑,模型必须在内部构建起对场景几何、物体构造成分和空间关系的深刻理解。 这种能力可以被“泵”出来用于稠密视觉任务。

挑战:如何从“图”中提取“量”?

将编辑模型视为视觉学习者的核心难点在于:这些模型输出的是像素(RGB),而视觉任务需要的是数值。作者为此设计了一套精密的解码流程(Prompt-and-Decode):

  • 深度估计:引导模型生成亮度代表距离的灰度图,利用 Affine Alignment 解决尺度偏差。
  • 表面法线:要求模型遵循标准的 RGB 法线编码协议,并引入了“自动轴校准”来适配不同的坐标约定。
  • 语义分割:让模型按指令(例如“路刷成红色”)生成掩码,通过颜色距离函数还原分类标签。

核心架构与方法

该方法最简洁之处在于其 非侵入性。它不需要修改模型代码,也不需要增加任何可学习参数。

模型架构与处理流程 图 1:图像编辑模型执行深度估计的流程,从左至右依次为原图、生成的灰度图、真实的深度图以及解码后的预测结果。

实验结果:震撼的 Zero-shot 战绩

在 NYUv2 测试集上的表现令人侧目:

  1. 表面法线 (Surface Normal):FireRed-Image-Edit 跑出了 17.69° 的误差,不仅击败了知名的微调模型 Marigold (20.86°),还打平了专门指令微调过的 Vision Banana。
  2. 深度估计 (Depth Estimation):长猫模型 (LongCat) 在室内场景表现出极强的相对几何恢复能力,δ1 达到 0.822。

实验结果对比 表 1:各模型在不同数据集上的深度估计量化对比,显示了开源模型跨领域的泛化性。

深度洞察:能力的瓶颈在哪里?

尽管 Zero-shot 能力强悍,但研究也暴露出一些“天花板”:

  • 格式遵循 (Format Following):有些模型虽然“理解”了场景,但无法严格输出纯净的调色盘颜色(例如在分割任务中出现渐变色),导致解码失败。
  • 语义混淆:在复杂的 Cityscapes 19 类分割中,模型虽然能定位物体,但有时会将指定的颜色搞混。
  • 几何优于语义:模型对几何(深度、法线)的感知显著强于对精细语义类别的区分。

总结与展望

这项工作证明了图像编辑预训练是一种极佳的“代理任务”。它不仅让模型学会了生成美图,还意外地赋予了模型理解物理世界 3D 结构的能力。

未来的启示:我们可能不需要为每个视觉任务都训练一个专用模型,通过提升生成模型的指令遵循(Instruction Following)质量,这种“通用的视觉推理引擎”潜力巨大。

发现相似论文

试试这些示例

  • 查找其他最近研究开源图像编辑模型(如 Stable Diffusion 变体)在 Zero-shot 稠密预测任务中表现的论文。
  • 哪篇论文最早提出了将视觉任务转换成图像生成任务(Image-as-Output)的范式,本文提到的 Vision Banana 又是如何在此基础上改进的?
  • 有哪些研究探讨了扩散模型预训练过程中的哪些因素(如数据分布或架构)最能促进几何感知能力的涌现?
目录
开源图像编辑模型:隐藏的 Zero-shot 视觉专家
1. TL;DR
2. 背景定位:不只是“修图师”,更是“视觉学习者”
3. 挑战:如何从“图”中提取“量”?
4. 核心架构与方法
5. 实验结果:震撼的 Zero-shot 战绩
6. 深度洞察:能力的瓶颈在哪里?
7. 总结与展望